{"as_of":"2026-08-10T04:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2153fba0992579563e415f4570788bd6b0b745177ffd70bb6fffe0d79b6fdede","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:47:59.378063Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T07:27:44.457158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-07T14:47:59.378063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17694","last_updated":"2026-03-28T10:14:51Z","snapshot_observed_at":"2026-08-07T14:40:02.904487Z","submitted_at":"2025-05-23T10:03:28Z","title":"CoDec: Prefix-Shared Decoding Kernel for LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.378063Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2505.17694"},"observation_digest":"sha256:7b6ada8e2ffe09163443148b5bdfe809717394b4fcab9af6daccc628f59b574e","observation_id":"de723323-0694-46f5-8a4c-dcd90f7cf9bd","resolution":{"observed_at":"2026-08-07T14:47:59.378063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2510.15596","last_updated":"2026-04-12T23:09:17Z","snapshot_observed_at":"2026-08-03T08:53:00.135911Z","submitted_at":"2025-10-17T12:41:37Z","title":"PRISM: Probabilistic Runtime Insights and Scalable Performance Modeling for Large-Scale Distributed Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T06:27:40.254366Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2510.15596"},"observation_digest":"sha256:fb77430f347382765a14fca7e2cab21bd9a69681863938e563fad7f2b7bee236","observation_id":"a531bbb9-9266-4ee2-8fbd-2c505209c3fb","resolution":{"observed_at":"2026-05-18T06:30:59.726041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-03T17:17:34.555509Z","title":"Context parallelism for scalable million-token inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.555509Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:70156d89dddbd99b9ee442050387770ebdc9e5b7b15bdc9b7cf1611562ecf9a8","observation_id":"855e07e4-b108-4c24-86cd-a60d72f0414a","resolution":{"observed_at":"2026-08-03T17:17:34.555509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-03T04:55:43.758571Z","title":"Con- text parallelism for scalable million-token inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-09T08:10:09.758139Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:43.758571Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:575536b0f776e701f7605a2e1116611f3df55af61edeaca2b346539de677c464","observation_id":"04656ae5-6a52-436c-bd45-ecf99efbe174","resolution":{"observed_at":"2026-08-03T04:55:43.758571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2604.08542","last_updated":"2026-04-09T17:59:50Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:50Z","title":"Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T16:56:14.380078Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2604.08542"},"observation_digest":"sha256:12e29eb51b51e1711ca31c245425f7b1a18993be4e8353a6dc472cc08d22c682","observation_id":"c00ec107-823a-42a1-989a-50fcfe9ee556","resolution":{"observed_at":"2026-05-11T07:50:59.717563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2604.15732","last_updated":"2026-04-17T06:16:32Z","snapshot_observed_at":"2026-08-02T15:30:13.684807Z","submitted_at":"2026-04-17T06:16:32Z","title":"Accuracy Is Speed: Towards Long-Context-Aware Routing for Distributed LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T08:15:45.474618Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2604.15732"},"observation_digest":"sha256:55f3815fe77a298734f0a6af0e0ec0870fd30e8d2bcbeee67d73e1cc12006ec6","observation_id":"3bbf67b1-a67e-47ae-ba30-5b67cafbbf4c","resolution":{"observed_at":"2026-05-10T08:17:37.475817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2605.00831","last_updated":"2026-03-26T13:27:57Z","snapshot_observed_at":"2026-08-08T10:38:53.859809Z","submitted_at":"2026-03-26T13:27:57Z","title":"GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T00:37:08.671539Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2605.00831"},"observation_digest":"sha256:e8af595bfa6320620da958c670bee8d088ecfeb3b5498643948bf251b9925640","observation_id":"5af68555-97f5-4986-ad77-b6ede239c494","resolution":{"observed_at":"2026-05-15T00:38:23.124324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2606.01502","last_updated":"2026-05-31T23:53:24Z","snapshot_observed_at":"2026-08-01T12:05:36.187697Z","submitted_at":"2026-05-31T23:53:24Z","title":"Move the Query, Not the Cache: Characterizing Cross-Instance Latent Attention Redistribution Across GPU Fabrics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T16:02:53.294235Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2606.01502"},"observation_digest":"sha256:b67bbc2608f166e67e18d80b83857de99eb8b5a1dfe4f1e78005f8e1def10a76","observation_id":"892ee340-59b7-4735-b4d8-5966013d2a57","resolution":{"observed_at":"2026-07-01T21:56:15.703053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2606.10493","last_updated":"2026-06-09T07:17:34Z","snapshot_observed_at":"2026-08-02T12:04:13.074478Z","submitted_at":"2026-06-09T07:17:34Z","title":"Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T12:06:46.806138Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2606.10493"},"observation_digest":"sha256:5842ae65c814be39eeaa9a8c8734d874d5c2136b856621a25a9675ac11f95fe1","observation_id":"4b8db0c8-f2d6-4491-91e5-8e39f5b70d46","resolution":{"observed_at":"2026-07-03T07:27:44.458605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2606.17059","last_updated":"2026-05-07T15:40:51Z","snapshot_observed_at":"2026-08-07T15:57:03.163515Z","submitted_at":"2026-05-07T15:40:51Z","title":"Towards Distributed Inference of LLMs on a P2P Network","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-30T23:13:57.705287Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2606.17059"},"observation_digest":"sha256:a8e51dca235f3be0b13e7698067eda217b0437527e07188939cdd197323e33cd","observation_id":"3fc6e178-fbbf-49ca-9ec6-df41b844ad57","resolution":{"observed_at":"2026-06-30T23:15:07.945392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":"2411.01783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-07-03T07:27:44.457158Z","title":"Context parallelism for scalable million-token inference","venue":null,"work_id":"12f1b1c9-af42-49fe-be5b-3b22809ea3b4","year":2024},"citing_paper":{"arxiv_id":"2606.29207","last_updated":"2026-06-28T05:16:17Z","snapshot_observed_at":"2026-08-05T18:19:52.152288Z","submitted_at":"2026-06-28T05:16:17Z","title":"KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T02:54:11.777615Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2606.29207"},"observation_digest":"sha256:25d0fe1fb4541515e9dccc8891fa2a091458c24d3a1096ed63a26f0c2b9a90d2","observation_id":"744dfe47-89ce-4be2-8d8f-d136776e890b","resolution":{"observed_at":"2026-06-30T03:04:14.241549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.01783/citation-record","integrity":"/paper/2411.01783/integrity","json":"/paper/2411.01783/citation-record.json","paper":"/paper/2411.01783"},"outbound":[],"paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2411.01783."}