{"as_of":"2026-08-12T10:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53074918063c53579a857fd54eea857685f681b4794b102e8a66213557b5a6c6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:50.830441Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:45.779352Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-08-07T11:20:50.830441Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02787","last_updated":"2025-06-03T12:14:17Z","snapshot_observed_at":"2026-08-10T02:22:46.475901Z","submitted_at":"2025-06-03T12:14:17Z","title":"Rethinking Dynamic Networks and Heterogeneous Computing with Automatic Parallelization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:50.830441Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2506.02787"},"observation_digest":"sha256:29f6fff4b3c925e739e9ae30b2aeaf66f99cb188efb582cb6c8767af25f2477e","observation_id":"212b88bf-4fd2-44cb-aa25-822f9488130a","resolution":{"observed_at":"2026-08-07T11:20:50.830441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-08-04T14:43:01.294927Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.23722","last_updated":"2026-07-03T02:44:15Z","snapshot_observed_at":"2026-08-04T14:42:54.705316Z","submitted_at":"2025-09-28T08:05:13Z","title":"OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T14:43:01.294927Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2509.23722"},"observation_digest":"sha256:e3a7a5c8f2fbe95705d4bfec472d1898f5f6717de6d913d8e025f9e6fc57db1b","observation_id":"e9187a99-8bee-4347-a13b-3a75ff5a9d5f","resolution":{"observed_at":"2026-08-04T14:43:01.294927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2604.07144","last_updated":"2026-04-08T14:37:17Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:37:17Z","title":"Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:40.021376Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2604.07144"},"observation_digest":"sha256:0f46f56036b09235ac2401967ae6c6eedd3289d851831c7d08f5c17c41e059ae","observation_id":"375f4a72-ba38-414c-bf02-ea84228555c2","resolution":{"observed_at":"2026-05-11T06:41:17.615643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2604.19654","last_updated":"2026-04-21T16:43:59Z","snapshot_observed_at":"2026-08-03T10:54:05.806041Z","submitted_at":"2026-04-21T16:43:59Z","title":"FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:18.241481Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2604.19654"},"observation_digest":"sha256:99abbb49a5bdfef721f39e751fe4617e32cadf2b4cc76b13b00b0a8adc3733c6","observation_id":"451ccf74-a7d9-4dc7-8c1a-2fb58b37f9cd","resolution":{"observed_at":"2026-05-11T13:41:05.466156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.07569","last_updated":"2026-05-08T10:41:04Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:41:04Z","title":"HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T03:00:19.355357Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.07569"},"observation_digest":"sha256:939c3f05b517cf2fa1ecb568d49d0ef72e4114f1e6e39f55c30cb492448a267c","observation_id":"880bfd4e-5e4c-492d-9bc2-d338a3384700","resolution":{"observed_at":"2026-05-11T03:00:55.678755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.16637","last_updated":"2026-05-15T21:09:34Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T21:09:34Z","title":"HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T20:58:51.630574Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.16637"},"observation_digest":"sha256:ebc506af138a74b979955564ae1e43f3d595f1fd6c0ef829a2b99448553dbebe","observation_id":"28976e67-9f84-4676-83dd-e844bb66414c","resolution":{"observed_at":"2026-05-19T21:02:47.406324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.21312","last_updated":"2026-05-20T15:40:18Z","snapshot_observed_at":"2026-08-02T01:15:29.579250Z","submitted_at":"2026-05-20T15:40:18Z","title":"Frontier: Towards Comprehensive and Accurate LLM Inference Simulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T03:47:49.835773Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.21312"},"observation_digest":"sha256:651af28c1a2617e9f16c46def24f2d655b4363dcf63c5622b700f4d5e894ea43","observation_id":"dcba0c51-3c7b-4f04-b769-4e61ac8c383e","resolution":{"observed_at":"2026-05-21T03:49:31.073602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2605.22014","last_updated":"2026-05-21T05:21:51Z","snapshot_observed_at":"2026-08-02T22:09:19.297160Z","submitted_at":"2026-05-21T05:21:51Z","title":"LiveR: Fine-Grained Elasticity via Live Reconfiguration for Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T04:26:56.343905Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2605.22014"},"observation_digest":"sha256:bf12b4e8d2da8b8bcc70b39b6c56d9b1bc0cfce7569be3dbc8c9ee773a9ab912","observation_id":"e2b278f7-2bcf-4a6f-a5c0-f22e8ad4e498","resolution":{"observed_at":"2026-05-22T04:31:03.955731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2606.11169","last_updated":"2026-06-09T17:48:41Z","snapshot_observed_at":"2026-08-03T00:36:26.241446Z","submitted_at":"2026-06-09T17:48:41Z","title":"Piper: A Programmable Distributed Training System","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:34:02.562929Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2606.11169"},"observation_digest":"sha256:4881351176458113d975db64a358979c84e9b4ac696ca746b44549a7c649783d","observation_id":"9a730153-3192-4064-8f26-bf1ccfa68fc1","resolution":{"observed_at":"2026-07-03T07:57:44.637394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism","version":1},"cited_work":{"arxiv_id":"2211.13878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13878","snapshot_observed_at":"2026-07-04T09:59:45.779352Z","title":"Galvatron: Efficient transformer train- ing over multiple gpus using automatic parallelism","venue":null,"work_id":"1f117f21-70fd-4c8f-aa80-8d7a54a2202c","year":2022},"citing_paper":{"arxiv_id":"2606.23087","last_updated":"2026-06-22T09:33:44Z","snapshot_observed_at":"2026-08-07T03:19:48.834246Z","submitted_at":"2026-06-22T09:33:44Z","title":"FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T09:13:19.671985Z"},"links":{"cited_paper":"/paper/2211.13878","citing_paper":"/paper/2606.23087"},"observation_digest":"sha256:d491baca62122466505dbf096d4d7809dae69312e95b10a43824888016d083df","observation_id":"5a3df194-1fbb-4f69-8da9-8454a94bfb9b","resolution":{"observed_at":"2026-07-04T09:59:45.780630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2211.13878/citation-record","integrity":"/paper/2211.13878/integrity","json":"/paper/2211.13878/citation-record.json","paper":"/paper/2211.13878"},"outbound":[],"paper":{"arxiv_id":"2211.13878","last_updated":"2022-11-25T03:45:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T18:17:27.435560Z","submitted_at":"2022-11-25T03:45:31Z","title":"Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2211.13878."}