{"as_of":"2026-08-10T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a4f860bccea67190ce761caa16650bccaaad35054ed1fcff2f784ebc34a46f5","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:59:30.126019Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.07706/citation-record","integrity":"/paper/2508.07706/integrity","json":"/paper/2508.07706/citation-record.json","paper":"/paper/2508.07706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:27.169990Z","title":"Demystifying parallel and distributed deep learning: An in-depth concurrency analysis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.169990Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:7de810671331b58a46796a6723081691e16b20fddd3087c7e225fb95a69e75ee","observation_id":"f371a397-1a4d-46c4-b066-1311d37c6a3a","resolution":{"observed_at":"2026-08-05T21:59:27.169990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/mlhpc.2016.006","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Distributed training of deep neural networks: Theoretical and practical limits of parallel scalability,","venue":null,"work_id":"9d1e42b8-b538-4a7d-998e-24fcc8bc46a9","year":2016},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.218234Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:28b4c5bdc8525e36b834ae77c0042b68dcd50b8ad608b7fb7e91ff81995d0dc6","observation_id":"67e313f9-16e9-4e14-9924-21993522d4ef","resolution":{"observed_at":"2026-08-05T21:59:31.099753Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-05T21:59:27.320114Z","title":"Pytorch distributed: Experiences on accelerating data parallel training,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.320114Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:ca35e04db116cc806f4ee89c8cdab48d77204b3a741db51e789a3564f3911525","observation_id":"00359b5e-e90d-474c-aa93-d23da34106c5","resolution":{"observed_at":"2026-08-05T21:59:27.320114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T21:59:27.378608Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.378608Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:c3edc776d677841e7a4d733bdf02b8cdc222aa10ea6d39ffa47635ccfeff29b0","observation_id":"a709d46e-aa97-4069-bf43-1fcc1e4fac44","resolution":{"observed_at":"2026-08-05T21:59:27.378608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T21:59:27.531983Z","title":"Large batch training of convolutional net- works,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.531983Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:cbb59f5dd7156c5d2b1499066d474ffa62c6954bc062b1b774be00cd5ee6d088","observation_id":"a1f2a9c6-63bc-434c-b70e-d4e9b35d6ff6","resolution":{"observed_at":"2026-08-05T21:59:27.531983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12650","last_updated":"2019-03-29T17:55:31Z","snapshot_observed_at":"2026-07-06T07:42:38.082715Z","submitted_at":"2019-03-29T17:55:31Z","title":"Yet Another Accelerated SGD: ResNet-50 Training on ImageNet in 74.7 seconds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12650","snapshot_observed_at":"2026-08-05T21:59:27.562665Z","title":"Yet another accelerated sgd: Resnet-50 training on imagenet in 74.7 seconds,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.562665Z"},"links":{"cited_paper":"/paper/1903.12650","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:6d761afac19f6421268069fb6362a21a2cf42a586d0691109416724501524be7","observation_id":"0bc787ed-712b-42e5-b8b2-6d0418f4fef8","resolution":{"observed_at":"2026-08-05T21:59:27.562665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.747063Z","title":"On the sdes and scaling rules for adaptive gradient algorithms,","venue":null,"work_id":"f1de6548-9b2b-46c3-9c7d-a84ef1ef7b85","year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.646664Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:7caaf3ee5775f193000c9df6a98727f6332d2127bf5d4b1cdb625d023253d95f","observation_id":"427ac881-5cd6-4533-8a14-cc364338b7ac","resolution":{"observed_at":"2026-08-05T21:59:32.807898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-023-00750-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Reporting electricity consumption is essential for sustainable ai,","venue":"Nature Machine Intelligence","work_id":"e1deb801-9b59-4976-b630-d4c15399490d","year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.724701Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:1ee8ad8cd835c416f0a6c0ac08acba4004ebba2a80dbddc63e7e7d7038d9c10e","observation_id":"50ccec83-acd6-45b1-8434-323c2e0ab803","resolution":{"observed_at":"2026-08-05T21:59:30.863080Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.15729","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.006714Z","title":"Energy costs of communicating with ai,","venue":null,"work_id":"7654feef-450c-4de3-8723-fd408cc5b17b","year":2025},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.799588Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:051468009b315c5d0c8e838ba36bd2beaba5265c50d8c482f9f12ac5cf22d0d2","observation_id":"b3776e7e-c861-4aa9-83b0-4d07f2d0c814","resolution":{"observed_at":"2026-08-05T21:59:32.102462Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:27.877668Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.877668Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:6e73e83e30d97f2570f6179213b0f1c97bf5f3fac0fd5430771fe7baf5aef27c","observation_id":"6c64d018-14c2-4c42-ae82-6cce68dbb2d2","resolution":{"observed_at":"2026-08-05T21:59:27.877668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:27.974322Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:27.974322Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:8a9f5205cc3bed4950940b6723e2360d142b1cec2f7165fa9ebb7df9f3bf36f5","observation_id":"e897bcd8-9554-47ef-804e-fe3301208637","resolution":{"observed_at":"2026-08-05T21:59:27.974322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11214","last_updated":"2022-02-22T22:19:35Z","snapshot_observed_at":"2026-08-02T21:09:07.860947Z","submitted_at":"2022-02-22T22:19:35Z","title":"FourCastNet: A Global Data-driven High-resolution Weather Model using Adaptive Fourier Neural Operators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11214","snapshot_observed_at":"2026-08-05T21:59:28.055078Z","title":"Fourcastnet: A global data- driven high-resolution weather model using adaptive fourier neural operators,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.055078Z"},"links":{"cited_paper":"/paper/2202.11214","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:9c0df5bfd7c78c88d4ec1f3f8501a7c875816be2cd8943e7cda6a1b5fa55b31e","observation_id":"19120c0c-cb6f-476f-8d5b-2f11fdb2c7e4","resolution":{"observed_at":"2026-08-05T21:59:28.055078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.601660Z","title":"Fourcastnet,","venue":null,"work_id":"b5235991-2a52-4507-bcb6-cf27fc88fdbc","year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.095834Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:1ede9373622cc58883959018c9e2944aa29e34cd90ae43d3416eae1bb1a3fa57","observation_id":"356f55b8-36f4-40ce-9052-5a88fd280233","resolution":{"observed_at":"2026-08-05T21:59:32.671958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:28.159277Z","title":"The era5 global reanalysis,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.159277Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:243319a7512686ba15f605cd0a7fe757496d9f358d429c044543a03001252343","observation_id":"f6f28c14-69fe-4059-a0ad-8369f7204003","resolution":{"observed_at":"2026-08-05T21:59:28.159277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:28.232442Z","title":"Green ai,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.232442Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:c123e59cc8d1eeb904324c21329a29d2717ad1d4b7799868810ff6d1d7da3f2d","observation_id":"2d4e2918-c97f-4778-aea9-4a5aaba9d453","resolution":{"observed_at":"2026-08-05T21:59:28.232442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.497458Z","title":"Quantifying the carbon emissions of machine learning,","venue":null,"work_id":"5bbe44b2-e4f9-47e8-9b33-a5d979d89f6d","year":2019},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.357010Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:dd1173d8e2141fc5c142a897f83ed979c323692dae30be71139f8b86927b8994","observation_id":"5ccaa54f-aac0-4b69-8f69-ed743031315c","resolution":{"observed_at":"2026-08-05T21:59:32.562391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01980","last_updated":"2023-02-05T11:36:51Z","snapshot_observed_at":"2026-08-03T19:10:10.376547Z","submitted_at":"2023-02-05T11:36:51Z","title":"Towards energy-efficient Deep Learning: An overview of energy-efficient approaches along the Deep Learning Lifecycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01980","snapshot_observed_at":"2026-08-05T21:59:28.450074Z","title":"Towards energy-efficient deep learning: An overview of energy-efficient approaches along the deep learning lifecycle,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.450074Z"},"links":{"cited_paper":"/paper/2303.01980","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:0877a372dea1784b5267d848092f938970d8d8a49b50f73af10f7347f03b2733","observation_id":"ad7c6112-3499-418f-986b-5da523c5078c","resolution":{"observed_at":"2026-08-05T21:59:28.450074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00967","last_updated":"2023-02-02T09:20:54Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T09:20:54Z","title":"Energy Efficiency of Training Neural Network Architectures: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00967","snapshot_observed_at":"2026-08-05T21:59:28.579827Z","title":"Energy efficiency of training neural network architectures: an empirical study,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.579827Z"},"links":{"cited_paper":"/paper/2302.00967","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:3b6c4f9abdb01ea2b836eccddd211cf2235d3e15b1082ab98a99cd991b90c04f","observation_id":"7f1a4b88-27f9-435d-8852-26034dd31492","resolution":{"observed_at":"2026-08-05T21:59:28.579827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08151","last_updated":"2024-03-13T00:27:19Z","snapshot_observed_at":"2026-07-06T17:43:40.149644Z","submitted_at":"2024-03-13T00:27:19Z","title":"Measuring the Energy Consumption and Efficiency of Deep Neural Networks: An Empirical Analysis and Design Recommendations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08151","snapshot_observed_at":"2026-08-05T21:59:28.682858Z","title":"Measuring the energy consumption and efficiency of deep neural networks: An empirical analysis and design recommendations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.682858Z"},"links":{"cited_paper":"/paper/2403.08151","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:b1e105ef5e34c0a0f31d4d1c8a1064268a254d802ea4e4ed3c9f4ac71450763d","observation_id":"53845b63-b8e3-442c-9ce6-0d1353f403c1","resolution":{"observed_at":"2026-08-05T21:59:28.682858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.399078Z","title":"Zeus: Understanding and optimizing GPU energy consumption of DNN training,","venue":null,"work_id":"86daeb07-8183-4711-85c4-195e9ed12178","year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.815520Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:da31244cd91a776836f672d27275b038747aad2c264527b076ec86b70b767e61","observation_id":"833f9304-ece3-48ec-a975-f6e8bc70db61","resolution":{"observed_at":"2026-08-05T21:59:32.431352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-23220-6_8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:33.414567Z","title":"Precise energy consumption measurements of heterogeneous artificial intelligence workloads,","venue":"Lecture notes in computer science","work_id":"37bc2f39-f47f-48c6-994b-0e3a1b00a5a3","year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.897210Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:a550d2838aad50c3e4e28acb10b1ae670a3fa0ad3d943cbf71ed5d37f4a6949d","observation_id":"b7bc85a2-51b8-42bb-bf1a-4338f9005273","resolution":{"observed_at":"2026-08-05T21:59:30.662721Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:28.945906Z","title":"Uncovering energy- efficient practices in deep learning training: Preliminary steps towards green ai,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.945906Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:1540f2a8264314c9327d258e90388b152dacdd3e34198d82025493791540ac18","observation_id":"d756c0f1-cadc-4862-bd94-34842ca00735","resolution":{"observed_at":"2026-08-05T21:59:28.945906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.284646Z","title":"Spend more to save more (sm2): An energy-aware implementation of successive halving for sustainable hyperpa- rameter optimization,","venue":null,"work_id":"25470b79-390c-4f92-ab53-e4d1c2375768","year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:28.993455Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:2c87ebdff4ec3d571b0a0ba21b7c57ce338f52318c6b1ffe88c28c4ffe7bcf01","observation_id":"1ac57e61-ab90-431e-9b8d-b8fae579316b","resolution":{"observed_at":"2026-08-05T21:59:32.349660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.146846Z","title":"The power of training: How different neural network setups influence the energy demand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.146846Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:3c2772e931ce274934c207825b447b6ba8ed02c746ed5de03dd9e717e7ecd609","observation_id":"6c619feb-4d48-4ac7-9249-e56bbd84f995","resolution":{"observed_at":"2026-08-05T21:59:29.146846Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.228207Z","title":"Benchmarking resource usage for efficient distributed deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.228207Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:5ec6409dca05bb9983ab1c28aa87a965b392087a5930918e0c9418fb9d967d84","observation_id":"de1dba3a-c4c4-4b62-bff6-06d3518170be","resolution":{"observed_at":"2026-08-05T21:59:29.228207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.266258Z","title":"Performance and energy aware training of a deep neural network in a multi-gpu environment with power capping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.266258Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:2b2989c6fa09968dcc218259ce79a4a0aab1e08f7ccbb39ef93f11a2d370ac3f","observation_id":"02a721d2-33ef-4627-8850-023c56a40281","resolution":{"observed_at":"2026-08-05T21:59:29.266258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06114","last_updated":"2024-04-09T08:35:04Z","snapshot_observed_at":"2026-07-06T17:57:35.831578Z","submitted_at":"2024-04-09T08:35:04Z","title":"Communication-Efficient Large-Scale Distributed Deep Learning: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06114","snapshot_observed_at":"2026-08-05T21:59:29.312593Z","title":"Communication-efficient large-scale distributed deep learning: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.312593Z"},"links":{"cited_paper":"/paper/2404.06114","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:fc138b9af2839b9bd88cbdbe8cb333f7a8af854645acbb71a8d59a488c9ec145","observation_id":"39a78f93-62ff-421f-8049-18203beaf1dd","resolution":{"observed_at":"2026-08-05T21:59:29.312593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.395915Z","title":"On efficient training of large-scale deep learning models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.395915Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:568a0c659984d5d8242e40f1b6abb1ad2215358210d8f092a80419497528ce1a","observation_id":"b0c3ba07-4152-4328-b3b2-0768c001e06c","resolution":{"observed_at":"2026-08-05T21:59:29.395915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:32.177551Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization,","venue":null,"work_id":"0225d87c-32fd-4ec6-b107-d5035bbe9409","year":2019},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.461661Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:66ac18803485f2d998baf614228e8ba70e9fa067264c1c584113d4e0bf81af0d","observation_id":"b79b2359-a693-4685-b767-7a07d31143b6","resolution":{"observed_at":"2026-08-05T21:59:32.220641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.30848","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:31.599091Z","title":"Learned Gradient Compression for Distributed Deep Learning,","venue":null,"work_id":"b2574b60-803c-4217-8bdc-38e452c92263","year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.524778Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:95f0e78960ca5ad605ff9903938db319c0698daac160dfbf3c79dc0545da022d","observation_id":"c4b60a6d-fa26-4245-9e97-74b0596a7389","resolution":{"observed_at":"2026-08-05T21:59:31.664240Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1106.5730","last_updated":"2011-11-11T15:59:15Z","snapshot_observed_at":"2026-07-06T02:30:01.730077Z","submitted_at":"2011-06-28T17:23:42Z","title":"HOGWILD!: A Lock-Free Approach to Parallelizing Stochastic Gradient Descent","version":2},"cited_work":{"arxiv_id":"1106.5730","doi":"10.48550/arxiv.1106.5730","metadata_source":"pith","pith_arxiv_id":"1106.5730","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"HOGWILD!: A Lock-Free Approach to Parallelizing Stochastic Gradient Descent","venue":"math.OC","work_id":"2faf15f5-5810-4bb3-8e62-1156a25c03d5","year":2011},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.665905Z"},"links":{"cited_paper":"/paper/1106.5730","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:edbd38d046e64ba28533e05d30cf6f7783e2c00a818d2c855c1bb849890f2b20","observation_id":"f7a37f95-4a06-4189-86ce-60f1e2912d17","resolution":{"observed_at":"2026-08-05T21:59:30.417365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07217","last_updated":"2020-02-17T11:42:10Z","snapshot_observed_at":"2026-08-09T03:16:31.553014Z","submitted_at":"2018-08-22T04:50:55Z","title":"Don't Use Large Mini-Batches, Use Local SGD","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07217","snapshot_observed_at":"2026-08-05T21:59:29.714665Z","title":"Don’t Use Large Mini-Batches, Use Local SGD,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.714665Z"},"links":{"cited_paper":"/paper/1808.07217","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:b47f1524cc062a2831701d6d9f10ce3815dc41a6a225a781549d41029543395a","observation_id":"8b256303-7dcf-4db7-b4b1-7c3de58b4a0e","resolution":{"observed_at":"2026-08-05T21:59:29.714665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.765634Z","title":"Accelerating neural network training with distributed asynchronous and selective optimization (daso),","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.765634Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:cf89df0dd72e70144382dcae49be3cf76c24f3700bb57d07797edbb338456da9","observation_id":"744b8164-e385-4fe1-a956-c347ef016450","resolution":{"observed_at":"2026-08-05T21:59:29.765634Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.815036Z","title":"Efficient data-parallel distributed dnn train- ing for big dataset under heterogeneous gpu cluster,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.815036Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:a985ebead14c1d7b07126ecef9b101a06507ed1291138aa6dd50e0f7b8fecbe8","observation_id":"d19973b9-498c-4292-a4f2-a7b39629def9","resolution":{"observed_at":"2026-08-05T21:59:29.815036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.862419Z","title":"An empirical study of training self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.862419Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:2a10e914734dc5aa2ec5ff6dbae9026d55f4e210ee7b0bb3fcf2b0259f37fcab","observation_id":"a3a67f4c-03ef-4ce0-8f8d-d7c967d6f517","resolution":{"observed_at":"2026-08-05T21:59:29.862419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:29.956300Z","title":"Fourcastnet: Accelerating global high- resolution weather forecasting using adaptive fourier neural operators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:29.956300Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:6dd0f1b9e729bb09d60653b5345fbfa8fd939ce912b7b455d9cde815fb96b1cc","observation_id":"1e2f485a-6e15-4fd4-a5bb-4c04b6ebaf77","resolution":{"observed_at":"2026-08-05T21:59:29.956300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-39698-4_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:33.414567Z","title":"Perun: Benchmarking energy consumption of high-performance computing applications,","venue":"Lecture notes in computer science","work_id":"7a8f05cb-4341-4526-b52b-2930fac47005","year":2023},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:30.024210Z"},"links":{"citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:8d90a48972396fa56c815726abb16d596e464f3fb4854f67478c6d08a910c3b2","observation_id":"69be2eda-f064-4629-a89d-5da9fbd6ac17","resolution":{"observed_at":"2026-08-05T21:59:30.257164Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-04T16:50:32.529025Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-05T21:59:30.126019Z","title":"Gpu lifetimes on titan supercomputer: Survival analysis and reliabil- ity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:59:30.126019Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2508.07706"},"observation_digest":"sha256:065cce0879dde2b796d5eed45105870a7da764908a38acef85aa2ee118a32c23","observation_id":"fb70ed2a-5bac-4d0e-aade-367028f1c443","resolution":{"observed_at":"2026-08-05T21:59:30.126019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07706","last_updated":"2025-08-11T07:34:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:46:05.653614Z","submitted_at":"2025-08-11T07:34:04Z","title":"Energy Consumption in Parallel Neural Network Training"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":23,"verified_exact":5,"verified_fuzzy":6},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2508.07706."}