{"as_of":"2026-08-09T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69bf23a10e26176dde05116aaf519700159218e67e0679bd2e607c82e434f0fb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:56.938309Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":55,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:8fb04db97aba6ac9f08a7d44f98455b21abe7dfadfe8c47e3e409214f92891cf","observation_id":"23efadb5-39a3-4564-96fa-05b7a3431662","resolution":{"observed_at":"2026-05-13T23:19:46.710952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:79aae584a4419673bbdfb3aa556eeba316aa9afedcc9f8835f99b099bfeb0906","observation_id":"5a993fea-6aa6-42ef-ab50-9fbbc7c9c94a","resolution":{"observed_at":"2026-05-10T22:46:40.812840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:20.027659Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2304.11277"},"observation_digest":"sha256:9e818e2cdbb6e1b69f2c878fd1382d1c13714f2a2dc022927003b06740b03ef5","observation_id":"e3169a5d-bf93-40d0-b0f4-2af1cd38ed7b","resolution":{"observed_at":"2026-05-12T04:15:20.079382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T19:28:28.201789Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2310.01889"},"observation_digest":"sha256:04e6080cc4af317d53904e2379f52cb5ffd75e59af4bbb55175a35de14ad5764","observation_id":"cba71a44-9ef7-4c93-85f8-b271d07509da","resolution":{"observed_at":"2026-05-12T19:28:28.258495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:0d72056d20f12788d8ebbd5627f3cd3e34e0a962ec77516a422c2bf69227bc1a","observation_id":"691d0b08-e397-4417-a090-0b2b67fe70d9","resolution":{"observed_at":"2026-05-18T10:31:03.874186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:b812c7fe79358318f461fb1fb872119e1beece6d4cc3f5f5c03f535e39808f98","observation_id":"6c13164e-123b-4bca-9aec-6c6c21527958","resolution":{"observed_at":"2026-05-22T23:07:14.441789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2504.09844","last_updated":"2026-04-27T14:30:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T03:31:22Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T21:12:22.201810Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2504.09844"},"observation_digest":"sha256:98d8b35d9d617c61028c323d01192c699c5fa185b5900d375413f1a384f4343f","observation_id":"c7c516d8-0213-4b7b-924e-62402ec17b46","resolution":{"observed_at":"2026-05-22T21:15:09.565107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2504.10013","last_updated":"2026-05-07T10:54:03Z","snapshot_observed_at":"2026-07-06T21:08:57.447867Z","submitted_at":"2025-04-14T09:17:47Z","title":"Training LLMs on HPC Systems: Best Practices from the OpenGPT-X Project","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T21:04:11.859563Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2504.10013"},"observation_digest":"sha256:98819c07aa134d45bdb163b84a12812eed5c5ca987221a6019b5dbf8f8513e89","observation_id":"6cf91668-8f56-47a2-9b89-8c4066a1a1d8","resolution":{"observed_at":"2026-05-22T21:05:09.524204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-07T00:30:56.938309Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-09T05:07:40.565767Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.938309Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:9faaf8527febecffaea00adf194c57936d91729809218f260acc7c3e0096ee4d","observation_id":"05cf9cdb-0e18-47b3-8b67-145d5b4307f4","resolution":{"observed_at":"2026-08-07T00:30:56.938309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T20:47:28.846985Z","title":"Reducing activation recomputation in large transformer models, 2022.URL https://arxiv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-08T02:43:34.071635Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.846985Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:6938604c4b88658f0411c253abafa9ce42bcead6ce023495acd015aa819fe8db","observation_id":"56cb0289-22aa-40af-8685-0e92e1d25712","resolution":{"observed_at":"2026-08-06T20:47:28.846985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T16:20:28.750375Z","title":"https://doi.org/10.48550/ARXIV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14000","last_updated":"2025-07-23T15:07:06Z","snapshot_observed_at":"2026-08-07T14:09:32.091436Z","submitted_at":"2025-07-18T15:14:56Z","title":"Photonic Fabric Platform for AI Accelerators","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:20:28.750375Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.14000"},"observation_digest":"sha256:460c3baf182b2330eb81be6e3b9a8632c5c68ce5a1389cb1c8a3e2de38522d67","observation_id":"ab079cb3-4ffd-4be9-96f4-13dc456ad6b2","resolution":{"observed_at":"2026-08-06T16:20:28.750375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-06T14:45:20.758677Z","title":"McAfee,MichaelAndersch,MohammadShoeybi,andBryanCatanzaro","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18006","last_updated":"2025-07-24T00:49:48Z","snapshot_observed_at":"2026-08-09T08:27:15.038300Z","submitted_at":"2025-07-24T00:49:48Z","title":"Unlock the Potential of Fine-grained LLM Serving via Dynamic Module Scaling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:20.758677Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2507.18006"},"observation_digest":"sha256:81f21d34907e3262dea774c4be7b7d45526b5ad35dbb45ef8baffa2d172e70a5","observation_id":"29feca7a-4ba7-4d1c-870a-f553e4fdb36f","resolution":{"observed_at":"2026-08-06T14:45:20.758677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:8b78e2db1e98599e4920fab09062594fefe1675a129a95176ed188d1345709a9","observation_id":"2310f253-5f7a-4c4f-b35c-c2b3c75cacbb","resolution":{"observed_at":"2026-05-18T20:41:50.661629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-07-06T22:24:38.247543Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:5d37d351ee5ffc550ed983adc5c605a237a457a92f5b99cc9f733989ec759862","observation_id":"1599cf5d-4ed1-448c-9376-f64d6d84fb65","resolution":{"observed_at":"2026-05-18T18:51:45.802088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2509.21275","last_updated":"2026-04-25T07:48:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-25T15:01:25Z","title":"InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T14:04:31.017142Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2509.21275"},"observation_digest":"sha256:45f78124a3e818bb5fbcc14fef18f2a5978aa3cfa27e078814d1d84272876ba6","observation_id":"e994574e-f6b7-406f-9d3a-6140912e951d","resolution":{"observed_at":"2026-05-18T14:06:27.277349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-03T22:28:46.339471Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10480","last_updated":"2026-06-26T19:59:05Z","snapshot_observed_at":"2026-08-09T19:17:08.259662Z","submitted_at":"2025-11-13T16:44:56Z","title":"Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:28:46.339471Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2511.10480"},"observation_digest":"sha256:ee1c93bb757cf6590d0ddb33f1a2875d7d5713ed263db6ee8126701c80e8664a","observation_id":"e0fd7fba-7f23-4a1d-9063-d8b7f7787471","resolution":{"observed_at":"2026-08-03T22:28:46.339471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-07T14:13:20.121484Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:0c2a47599feba9cc484b85f0104ebe70286a91829017663c056be44ee703b956","observation_id":"12782da5-748a-4f8c-b556-b6116eb53347","resolution":{"observed_at":"2026-05-18T01:40:42.615219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T21:11:49.812534Z","title":"Reducing activation recomputation in large transformer models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-07T08:21:33.678621Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.812534Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:1b14ba43fb2091817831298f722060b8a97cce6f894fa97d969f3f3615aaab09","observation_id":"25597e34-7a25-4688-a37f-d0c9ac86d4fa","resolution":{"observed_at":"2026-08-02T21:11:49.812534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T20:59:24.724128Z","title":"Langley, P","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-09T16:45:20.419638Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T20:59:24.724128Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2602.21788"},"observation_digest":"sha256:8861f5ce61c707ed6eab75e335616715abb7ce221ad681c88cb7eb8984a3fafb","observation_id":"44a5279e-e3ff-4c8f-aa1e-c570a6561d63","resolution":{"observed_at":"2026-08-02T20:59:24.724128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.14561","last_updated":"2026-04-21T03:27:38Z","snapshot_observed_at":"2026-08-01T16:25:53.172850Z","submitted_at":"2026-04-16T02:43:06Z","title":"CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T10:23:19.236803Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.14561"},"observation_digest":"sha256:1ac2b075a0b3a7c9373b3e126a29512c05859c1dd5a92d7ba2a9c41bfed276b6","observation_id":"b2543f4e-0d6d-47cd-9f31-2669ecf6a87b","resolution":{"observed_at":"2026-05-10T10:24:20.560853Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.21428","last_updated":"2026-04-23T08:45:38Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T08:45:38Z","title":"Decoupled DiLoCo for Resilient Distributed Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:20:21.090246Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.21428"},"observation_digest":"sha256:f260ef2725aa6fdcda27bb139efe68ed6ca782dfbcd42d1bca89455e9b221583","observation_id":"570aaedd-d074-469c-ab98-e26078be9db5","resolution":{"observed_at":"2026-05-09T22:49:15.683024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:efb16090a77cf28037e4e7b41a89f7e51b444d2391144ba79b5beb57a4d7a5cf","observation_id":"01b389ca-2465-4751-aeb1-731fb8ab9bfa","resolution":{"observed_at":"2026-05-12T09:31:26.808957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.05049","last_updated":"2026-05-06T15:47:14Z","snapshot_observed_at":"2026-08-02T19:55:25.393308Z","submitted_at":"2026-05-06T15:47:14Z","title":"Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T17:04:02.418499Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.05049"},"observation_digest":"sha256:ac6470897b466d2f8c1e61fdd6598d4abe8392704f5778dc7da6663bec4ee606","observation_id":"626393f0-cf06-4885-8f1f-e18a1ba5e337","resolution":{"observed_at":"2026-05-11T17:51:07.974000Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:1397cb119e3aec1a277c27d35302fe80d729f12df63e9e10ff8447732a2d89b6","observation_id":"8b587fa3-48b1-4433-8d58-456f31566783","resolution":{"observed_at":"2026-05-12T02:06:15.053308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2605.20799","last_updated":"2026-05-20T06:44:25Z","snapshot_observed_at":"2026-08-03T14:15:31.862715Z","submitted_at":"2026-05-20T06:44:25Z","title":"Instant GPU Efficiency Visibility at Fleet Scale","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T02:43:09.077121Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2605.20799"},"observation_digest":"sha256:171b3471578f22f91ae3e86eb543079977f577bdca134011be453bc7bb5835ae","observation_id":"99be7701-2fdb-4847-b917-fbca9bf0467d","resolution":{"observed_at":"2026-05-21T02:43:54.741443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":"2205.05198","doi":"10.48550/arxiv.2205.05198","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kuaishou","venue":"arXiv (Cornell University)","work_id":"95aeb8ec-f2a2-4ca9-b63d-125f9638d395","year":2024},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-09T15:13:58.379074Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:20:53.599064Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:762afd70db77c429fce19883c66654a0f0f8a3229a46f4eaca0efac9ee7c5304","observation_id":"f8d65840-193a-47fe-8a6c-495610f149ab","resolution":{"observed_at":"2026-07-02T20:37:22.529353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:21.423141+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-07-15T10:54:16.434702Z","title":"Li, B., Chen, F., Huang, Z., Wang, L., and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-09T15:13:58.379074Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T10:54:16.434702Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:09279e61d41f92e122ec5adba3274e9588133721167c835cfc22f403d94e3045","observation_id":"0c493078-284b-448d-af6a-03d51e9a3e57","resolution":{"observed_at":"2026-07-15T10:54:16.434702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T12:13:46.609563Z","title":"Li, B., Chen, F., Huang, Z., Wang, L., and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-09T15:13:58.379074Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:46.609563Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:054c089922cf165834a0c690862323229d9f9530f9f22150fb39a1a1608a1ee6","observation_id":"8d91bf9b-23e5-4d5a-98c0-f507144fa1b9","resolution":{"observed_at":"2026-08-02T12:13:46.609563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T04:42:46.028286Z","title":"Reducing acti- vation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14172","last_updated":"2026-07-15T09:42:59Z","snapshot_observed_at":"2026-08-09T09:15:25.126668Z","submitted_at":"2026-07-15T09:42:59Z","title":"The Cost and Network Limits of Space-Based AI Compute","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:46.028286Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.14172"},"observation_digest":"sha256:5dc38131121b38efa863d762144030c21d6a075e22a3abd2e09955c3f5688e1f","observation_id":"faa07337-c6ca-41dc-a16f-b1657d9e5bd8","resolution":{"observed_at":"2026-08-02T04:42:46.028286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T00:41:45.462772Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14952","last_updated":"2026-07-27T13:07:41Z","snapshot_observed_at":"2026-08-08T19:48:49.069016Z","submitted_at":"2026-07-16T13:00:32Z","title":"LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:45.462772Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.14952"},"observation_digest":"sha256:ad8b961b6a5857baeeb3515f22c52f55024154763f1297bbfb83018fff98f5a9","observation_id":"a31fe6a3-500d-467f-9f96-095c7d2e8fba","resolution":{"observed_at":"2026-08-02T00:41:45.462772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-01T17:32:37.263658Z","title":"Li, J., Jiang, Y ., Zhu, Y ., Wang, C., and Xu, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-07T15:41:17.993721Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.263658Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:f94a878ff140233cdead64b8cba4939f109a653f9ef58b40ac3fd9eeca4982cc","observation_id":"58bacf8a-3c44-477c-ad9a-a7ebad505fcb","resolution":{"observed_at":"2026-08-01T17:32:37.263658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-01T06:48:44.020572Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-07T09:56:42.250730Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:44.020572Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:0788216ef9d27c3e6a5860bbca00f0a65250647111d3e27612532b3204fff100","observation_id":"2b777e7d-da11-4b27-8c90-c084795671c0","resolution":{"observed_at":"2026-08-01T06:48:44.020572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2205.05198/citation-record","integrity":"/paper/2205.05198/integrity","json":"/paper/2205.05198/citation-record.json","paper":"/paper/2205.05198"},"outbound":[],"paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2205.05198."}