{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcd493e508fef89aeac8deafab7a767b2d9bc234be2eda0508e8ecdbe638610c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:18:07.705592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:59:03.322421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:10a678338d86240fffe1e8fc5d367cca152dd1247d0e6886457defc2fe6d20a9","observation_id":"39900118-976a-4971-8a9c-d9c4cbe878d9","resolution":{"observed_at":"2026-05-17T18:00:50.431176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:ae03a323ed793b45e6877e9693241b53837bdf649e795a7045c9f7de8ac7e9ec","observation_id":"08dccdd5-98d0-49e9-8fc2-68424e18710b","resolution":{"observed_at":"2026-05-12T15:03:07.819111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-09T05:18:07.705592Z","title":"Deep- speed inference: Enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05220","last_updated":"2025-02-05T15:46:27Z","snapshot_observed_at":"2026-08-09T05:12:48.658321Z","submitted_at":"2025-02-05T15:46:27Z","title":"Aero-LLM: A Distributed Framework for Secure UAV Communication and Intelligent Decision-Making","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T05:18:07.705592Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2502.05220"},"observation_digest":"sha256:30939770e8a7b59ca210209522ec006d7cc4b745a56fe6870f7e4d842d19a04a","observation_id":"dd5d2662-76b1-44e0-91a3-18f9d06fb1ef","resolution":{"observed_at":"2026-08-09T05:18:07.705592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T15:39:16.021201Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14419","last_updated":"2025-05-20T14:31:15Z","snapshot_observed_at":"2026-08-09T05:18:32.061106Z","submitted_at":"2025-05-20T14:31:15Z","title":"SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:16.021201Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.14419"},"observation_digest":"sha256:de2e282b20750a4926f056e3fb0f91e71a47a99295f73d3e0c23714affa8155b","observation_id":"58157a7a-196f-4952-a0fe-cc8c9c97bf12","resolution":{"observed_at":"2026-08-07T15:39:16.021201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T13:32:29.198408Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.198408Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d10a7710546117f77e0f530a6aa3ff8d88ebb8b95355a5504b3153a0a42ecf5d","observation_id":"c8abc7c3-bda3-4139-8f81-e0cb39023140","resolution":{"observed_at":"2026-08-07T13:32:29.198408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T13:12:55.546676Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22501","last_updated":"2025-05-28T15:50:48Z","snapshot_observed_at":"2026-08-07T13:03:18.495419Z","submitted_at":"2025-05-28T15:50:48Z","title":"EvolveSearch: An Iterative Self-Evolving Search Agent","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.546676Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.22501"},"observation_digest":"sha256:45b1fcf9b1968f34d5d0e57ea1d18694d9565c2861f39f6e1b9f026efbe03e47","observation_id":"2f5b486c-3f15-42ee-8066-5e3bcf0cabab","resolution":{"observed_at":"2026-08-07T13:12:55.546676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T17:47:58.019030Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2509.09505"},"observation_digest":"sha256:4c221df0d700227237d924dc239807b81088e48ed7f30cadd0975090d16dd99d","observation_id":"1bc7a03b-05fc-4f7c-abe1-632d5628a92a","resolution":{"observed_at":"2026-05-18T17:51:42.268813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2602.05695","last_updated":"2026-02-23T09:49:19Z","snapshot_observed_at":"2026-08-07T18:14:32.956858Z","submitted_at":"2026-02-05T14:21:00Z","title":"SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:56.380048Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2602.05695"},"observation_digest":"sha256:4193c59d8113b9232163a2754d05746d8836a5e5629873c89a8a09ab562aeb41","observation_id":"de56e279-cca7-41aa-b6f5-8e0a892fad08","resolution":{"observed_at":"2026-05-16T07:07:29.589719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:8ca91a00cfecfdd37bd36cec6c7b5bd99c4df0b1450108435ebccbf9b9f4d915","observation_id":"48682b07-9fa5-4f44-9259-f8e962a6d74b","resolution":{"observed_at":"2026-05-11T11:31:01.439048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:18:05.789417Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:b1ca8e71a396fdf3cb54ddd8d45562b5f35bd3c092e2391984a0cf12edc2acc1","observation_id":"97c1c357-ece0-4476-ad31-83fd25f2782d","resolution":{"observed_at":"2026-05-11T17:41:08.897769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:49:16.271699Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:ca80099742d85ada4f3d3be9119722972fc1b19b01095367aaeaa5dc2011eca8","observation_id":"4b7cea5c-8342-4858-b4d1-0379d2ba33f4","resolution":{"observed_at":"2026-05-15T06:49:48.919062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-03T02:23:43.898162Z","title":"Deepspeed inference: Enabling efficient in- ference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.04215","last_updated":"2026-07-31T15:51:37Z","snapshot_observed_at":"2026-08-05T23:14:25.096835Z","submitted_at":"2026-05-05T18:55:24Z","title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:43.898162Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.04215"},"observation_digest":"sha256:a78f02b231a938744694a74e3efa4724246c5611d3c45057e0e7dc83b8b614cd","observation_id":"e122ca3f-c6ac-4e43-8450-0c2acab501e7","resolution":{"observed_at":"2026-08-03T02:23:43.898162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.11111","last_updated":"2026-05-11T18:20:10Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:20:10Z","title":"ShardTensor: Domain Parallelism for Scientific Machine Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T03:03:32.316700Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.11111"},"observation_digest":"sha256:77500f6591258885e3962c888baca8bcaf8eb14a4a3d9a316521418c763c3aca","observation_id":"bafbf0de-24ce-459a-8c15-d717f12901b7","resolution":{"observed_at":"2026-05-13T03:07:09.104038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.18750","last_updated":"2026-05-18T17:59:18Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:18Z","title":"A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:35:32.225708Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.18750"},"observation_digest":"sha256:5fe56c9f79fb9431ae18752bff6bc2ea5b78d164018a9b88cdedded50e24cb12","observation_id":"a83bf6aa-9455-413c-b910-edc84e1334a9","resolution":{"observed_at":"2026-05-20T07:38:09.365091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2605.27763","last_updated":"2026-05-26T23:22:55Z","snapshot_observed_at":"2026-07-31T18:23:26.053584Z","submitted_at":"2026-05-26T23:22:55Z","title":"A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T18:03:19.798168Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2605.27763"},"observation_digest":"sha256:6ba2fa3879fba70475f4121a5918e244576edbe17d1c316e819871fcde2686b4","observation_id":"0bf0fca9-42f7-4096-af22-a01062156484","resolution":{"observed_at":"2026-06-29T18:03:47.843565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2606.17566","last_updated":"2026-06-16T06:12:05Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T06:12:05Z","title":"AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T23:07:13.368633Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2606.17566"},"observation_digest":"sha256:5f36b8dfdbbe45d607b9555b913ef19f752c1ac34fd4d0cbbd2a7c79d29c8c3f","observation_id":"2ca665c7-8363-4c6b-8dd6-93f5aa9b6272","resolution":{"observed_at":"2026-07-03T22:59:03.324627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2606.27797","last_updated":"2026-06-26T07:30:41Z","snapshot_observed_at":"2026-08-03T22:47:57.900369Z","submitted_at":"2026-06-26T07:30:41Z","title":"Optimizing Teacher-Student Partitioning for Scalable Knowledge Distillation on HPC Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T03:06:29.733729Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2606.27797"},"observation_digest":"sha256:0c401d6439535de218b9e3daf6e05341a227f1b9d4611c99f91786302d6f0378","observation_id":"009c2579-6677-4a94-b3b7-aa8f7fa29de0","resolution":{"observed_at":"2026-07-01T17:45:52.278510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-08-05T09:51:09.302562Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:494cee338f4afaf64275af002ac179fdedfdcfb5a3a47a6c4c3f8a8fb1fc464d","observation_id":"46693fd0-7386-4723-be2c-47a2a130340c","resolution":{"observed_at":"2026-07-02T15:57:06.415052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2207.00032/citation-record","integrity":"/paper/2207.00032/integrity","json":"/paper/2207.00032/citation-record.json","paper":"/paper/2207.00032"},"outbound":[],"paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2207.00032."}