{"as_of":"2026-08-17T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9666e6286fd775904b8edce94a0cae2cf9c5eb3b227b597adbe460d6b2fa5847","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:37:15.720135Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.10395/citation-record","integrity":"/paper/2508.10395/integrity","json":"/paper/2508.10395/citation-record.json","paper":"/paper/2508.10395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.309709Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"1809affb-e914-45cb-a5a4-7de130a5b5f6","year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:11.718326Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:047f87304b8e447544c4b397dbb29ebed4888d1c8bcb5bf7cb233e6d146fe955","observation_id":"2c1eef06-70f8-4abe-a5f2-a32206256e35","resolution":{"observed_at":"2026-08-05T20:37:16.313365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.298291Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"f6d93d76-1681-4ec0-9de3-72e6f2dd1452","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:11.802675Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:1c7bc3a2706525d1ea82dd7291dc531f07097c9fc4b0d64c0605cb86691327ce","observation_id":"7b5c91f9-60f9-4118-a663-eaaae8bdc347","resolution":{"observed_at":"2026-08-05T20:37:16.302365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:11.866338Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:11.866338Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:e74ebd08801a35f3d6f932c439f75141f8124ec1519892f163a8ec160783e0cb","observation_id":"3f524b65-db83-47c7-aff0-08794c3652b9","resolution":{"observed_at":"2026-08-05T20:37:11.866338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18893","last_updated":"2026-05-27T05:57:00Z","snapshot_observed_at":"2026-08-16T12:47:16.033749Z","submitted_at":"2025-03-24T17:06:37Z","title":"xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18893","snapshot_observed_at":"2026-08-05T20:37:11.923378Z","title":"xkv: Cross-layer svd for kv-cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:11.923378Z"},"links":{"cited_paper":"/paper/2503.18893","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:166f21b927981ed5cfb6188ec29156ef5ff7f936d49b7058fa8c62eabb06f921","observation_id":"2323e10e-2681-401c-858c-2587f9bb0dbb","resolution":{"observed_at":"2026-08-05T20:37:11.923378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.280496Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":"08af2ac0-0044-4ce4-b636-4906befe6bf8","year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.013603Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:de8b5cfd577871945359b4d8ebaf645db3cb6734ebceb5d0de631125bf4d03cc","observation_id":"d4076f9b-e933-4659-91f9-57fa21f5e753","resolution":{"observed_at":"2026-08-05T20:37:16.283985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:12.072745Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.072745Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:caefd0cf8cbc2dbd98c37fd598d349768cba3490216e4550977df057a9c05cea","observation_id":"afbd76c2-0382-4128-88f0-b7113a4bcdad","resolution":{"observed_at":"2026-08-05T20:37:12.072745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:12.157932Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.157932Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:6b2cee037fd5d55b36c4a30731e62db7a2bb1d0561ea0f3454ebc03c6f3178d4","observation_id":"8f1ba5c9-83b4-4e4c-90bf-d2082ebd2070","resolution":{"observed_at":"2026-08-05T20:37:12.157932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:37:12.244737Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.244737Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:a3e5c5901d4a9baa14a812457fc8f787ad11731b90adb9605dfeaf0018173ad0","observation_id":"15832a7a-6a4d-4b8e-ae9c-372c89b42146","resolution":{"observed_at":"2026-08-05T20:37:12.244737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:12.334012Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.334012Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:6ee0b0206297b9be1ddd4776d496287d3fef5c8d4fffdec0485edf23ace95361","observation_id":"0aa150db-c316-4ac7-98f4-70d155a558a1","resolution":{"observed_at":"2026-08-05T20:37:12.334012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.247220Z","title":"Fast state restoration in llm serving with hcache","venue":null,"work_id":"5659dac0-139a-42ff-b1d6-4864d8685082","year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.399294Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:a2badedbd93c4d7b8d3ec0a39378dadcbaab6505a7b551b95cc821ac14118ed0","observation_id":"c15ce080-4ef0-490b-a6b5-09817e47bc31","resolution":{"observed_at":"2026-08-05T20:37:16.250581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.235916Z","title":"Ai and memory wall","venue":null,"work_id":"9e5cbe0c-9f40-4cca-8275-66451b4021cd","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.480539Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:23a499f351e7a4d3bc12fcb057f2e8c5c7e329f7cbb8e43a0d282e3a222d889d","observation_id":"7e72e24a-621d-4c84-b7fc-4b430db5f4b6","resolution":{"observed_at":"2026-08-05T20:37:16.239833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05840","last_updated":"2025-06-03T03:04:10Z","snapshot_observed_at":"2026-08-16T12:52:19.103757Z","submitted_at":"2025-03-07T01:44:52Z","title":"Slim attention: cut your context memory in half without loss -- K-cache is all you need for MHA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05840","snapshot_observed_at":"2026-08-05T20:37:12.575486Z","title":"Slim attention: cut your context memory in half without loss–k-cache is all you need for mha","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.575486Z"},"links":{"cited_paper":"/paper/2503.05840","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:490952c807923e85899508ccbac8e6397b8640a18f15e1f337969815b1d4d7e2","observation_id":"e5e2d711-c226-46b9-899b-1bb84e4f5ea4","resolution":{"observed_at":"2026-08-05T20:37:12.575486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-15T21:58:34.589761Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02617","snapshot_observed_at":"2026-08-05T20:37:12.660388Z","title":"Polarquant: Quantizing kv caches with polar transformation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.660388Z"},"links":{"cited_paper":"/paper/2502.02617","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:8847197003404b5d0656478a90092a56fb603dd8a957aaa9d785089f44eb6518","observation_id":"9855f0ae-3af8-485a-be6a-c2bcf512839b","resolution":{"observed_at":"2026-08-05T20:37:12.660388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.225449Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":"47826ab0-84eb-4400-a59e-de00746204f5","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.754333Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:1c4f69b7234860e56cfe4937b4abde03835687dd33350f33ddfbf63739d8b7aa","observation_id":"3968a25b-49c7-4b2c-a48d-fec801aa1f4c","resolution":{"observed_at":"2026-08-05T20:37:16.228837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:12.874359Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.874359Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:04b2c39a022b9e9988c503d8aa75d1fe98808ca5774505cbcc5d87e053f1fc52","observation_id":"631dec7d-3102-4409-a021-98f27c8b7cb3","resolution":{"observed_at":"2026-08-05T20:37:12.874359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:12.989497Z","title":"Checkmate: Breaking the memory wall with optimal tensor rematerialization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:12.989497Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:d9cead6a0c9ba70af6a084ee9a1feb85820269d05021f64aa93960ade05dab27","observation_id":"a2d231dd-b670-40fb-aa4a-bff9f51e1fe8","resolution":{"observed_at":"2026-08-05T20:37:12.989497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.202173Z","title":"Residual connections encourage iterative inference","venue":null,"work_id":"d5089747-f2a7-438d-9fe4-0540e9aadc9c","year":2018},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.070387Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:906130066a8d553dec8da741038281a88b544b66c2b0e3d31c433b040497241e","observation_id":"ce27969a-f689-4ccb-9730-79aa815ebc1d","resolution":{"observed_at":"2026-08-05T20:37:16.205712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T20:37:13.135459Z","title":"Mistral 7b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.135459Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:1397f6a20c4b3dd0f02cabf9fe6bc61add857f9a8bb8c940234b3cd85051692c","observation_id":"4b9171b1-b443-4307-925a-a6c3eb5e615d","resolution":{"observed_at":"2026-08-05T20:37:13.135459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.192495Z","title":"Mahoney, Sophia Shao, and Amir Gholami","venue":null,"work_id":"7e9b6baf-02e3-45ba-a77c-31f40bc53ac8","year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.221672Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:575b6ac60cca3edcae16a6270dd2c21f9692e2045ae39864075f15a60af5c84b","observation_id":"6c9e2511-d8cd-4035-97bf-314a49baa76e","resolution":{"observed_at":"2026-08-05T20:37:16.195749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.182957Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":"d0cdf6f4-9851-4725-9beb-9986ed19a784","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.297646Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:978298ac9dccfb60c2c8db7af877771977f920ae0df5081e481425a4ce693437","observation_id":"16de2b6d-3f68-4667-ae85-a82b0265a614","resolution":{"observed_at":"2026-08-05T20:37:16.186133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:13.347682Z","title":"Efficient llm inference with activation checkpointing and hybrid caching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.347682Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:81b538952319114cb20f47aede7b781cde88f016a9e64a3e2efd1a2d26eeedc5","observation_id":"66d614fa-0a90-4ecb-9a66-70505ce68cc1","resolution":{"observed_at":"2026-08-05T20:37:13.347682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.172832Z","title":"Intactkv: Improving large language model quantization by keeping pivot tokens intact","venue":null,"work_id":"2b0bb0b8-10cd-464d-a393-3fdd3f8d1cb6","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.424917Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:b00a9007f384a146120f9694cd183a46409a9324a7e2b0c745c2e5feab6dd1fe","observation_id":"aac11420-51eb-4b86-9915-ce5839478833","resolution":{"observed_at":"2026-08-05T20:37:16.176321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:13.510276Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.510276Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:80052fddb3f88e9caa6640b34a5deb9109d63ffa02e3ae9323fb1ab880ec3a7a","observation_id":"6ec37ac1-38a1-4b1f-993f-383e9afd8792","resolution":{"observed_at":"2026-08-05T20:37:13.510276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:13.576293Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.576293Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:1fbd7fa2762c5196d45955be74de440e099f281d03b8e0ce8a0382f29189c4ec","observation_id":"5075b5bd-4990-41d5-9345-1bff31bedf0c","resolution":{"observed_at":"2026-08-05T20:37:13.576293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.150957Z","title":"Llama 3.1: https://ai.meta.com/blog/meta-llama-3-1 , 2024","venue":null,"work_id":"972b9791-dd1f-417e-92a5-f885929ea29e","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.666970Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:51204c7f2f5e3086bbac6fe39083d66cd01bd1559929aa581cc1110e81ce44d7","observation_id":"2a402916-1310-475a-9143-b456d4ba0e3c","resolution":{"observed_at":"2026-08-05T20:37:16.154060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:13.746229Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.746229Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:05d4a3de379e1cf56de17ae8aac3285e4a39dd1c422a43209eef543ffe452a3c","observation_id":"0a2e3a84-3e2c-44d5-bbdd-27c0cbbb5682","resolution":{"observed_at":"2026-08-05T20:37:13.746229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.133059Z","title":"Magicdec: Breaking the latency-throughput tradeoff for long context generation with speculative decoding","venue":null,"work_id":"1d917029-b5a6-4600-8153-665e6ca69153","year":null},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.829043Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:09fed88d5a527668e24724caf3871aca553a68047cebfa09aea6d43a36a579d2","observation_id":"07d52c83-fe05-43e7-b10e-22b823fdc017","resolution":{"observed_at":"2026-08-05T20:37:16.137087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.122985Z","title":"Eigen attention: Attention in low-rank space for kv cache compression","venue":null,"work_id":"4b366703-9e34-4f28-a543-9e5d9470e560","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.892816Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:39401f12d8f567f42c36107a52a4ec75fe6b10886d0001de6c4990df9668cb9c","observation_id":"1c5359fa-7684-4b7f-928f-63b05c1448c7","resolution":{"observed_at":"2026-08-05T20:37:16.126325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.113778Z","title":"Loki: Low-rank keys for efficient sparse attention","venue":null,"work_id":"48a2c5cb-e6fe-456f-a1ff-70f3505e799a","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:13.962201Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:0cb0d5122b89b2c8f679b7be0593a5bf8323347ebd722084d61662021c3446f3","observation_id":"fdbb958f-2b72-49ba-abe2-c377589a0e98","resolution":{"observed_at":"2026-08-05T20:37:16.116849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.103936Z","title":"Roformer: Enhanced trans- former with rotary position embedding","venue":null,"work_id":"490587b0-3518-498c-9d9a-b9a5b945d93e","year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.040351Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:5fe1ef2df28c8d80156e5745d200eb48f848818af5a830ff46e77b510ad9f6bf","observation_id":"7d51c3f3-3efb-44ae-9b02-a22e32eeed36","resolution":{"observed_at":"2026-08-05T20:37:16.107223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T20:37:14.106347Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.106347Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:f58f64406f4a95a0fde41aad7473f2488b316d4481bae6033ecbccba7aaaf646","observation_id":"06966c43-271f-4c7e-8221-fa75e02016c8","resolution":{"observed_at":"2026-08-05T20:37:14.106347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.094107Z","title":null,"venue":null,"work_id":"32e077f0-4dd8-42fd-9573-71586145958c","year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.177445Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:184c57b238a022d5cecb87c8728c1e320294c99d0d47d635dc6255db4667521d","observation_id":"136be86f-4dfc-459c-addb-b7adc00bee00","resolution":{"observed_at":"2026-08-05T20:37:16.097187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.084089Z","title":"Quantspec: Self-speculative decoding with hierarchical quantized kv cache","venue":null,"work_id":"e9493943-7127-4596-9045-af6c903ae2ee","year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.251524Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:1494518cf75dc3f75456412c916bffc4e28fd1311232a8ee2cfdff7cd585b1b5","observation_id":"7c385cdb-0eda-40c7-b86b-c8145ab0f465","resolution":{"observed_at":"2026-08-05T20:37:16.087682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:37:14.314482Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.314482Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:3a93a75fd115bb1394fe853cee45d20261af6865882edbd25a639c35d027c9e0","observation_id":"047f1126-b2f5-4fa9-9538-fa1d4a02bbd8","resolution":{"observed_at":"2026-08-05T20:37:14.314482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T20:37:14.389766Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.389766Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:b79b720873c0902b604cfa5df7067ad1c80ef007112f4dcbae377346663bbfd8","observation_id":"0ac099aa-ddd4-4725-bf1a-129e143d515e","resolution":{"observed_at":"2026-08-05T20:37:14.389766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:14.452375Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.452375Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:14c47122037c30a119143bfdf73cb8397ebee98f2236da79cf091384ac29cd5c","observation_id":"4a0741e7-31e9-4492-bafa-6d4b2456f1bf","resolution":{"observed_at":"2026-08-05T20:37:14.452375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:14.495134Z","title":"Roofline: an insightful visual performance model for multicore architectures","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.495134Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:3c89837fe70d8213020e887d4e6b6cfff32fa6a1c9e416d5b56823fa11438d78","observation_id":"4745bc3d-d048-4169-bed1-831077355f13","resolution":{"observed_at":"2026-08-05T20:37:14.495134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00527","last_updated":"2026-06-05T09:55:33Z","snapshot_observed_at":"2026-08-15T03:05:40.898471Z","submitted_at":"2025-02-01T18:59:03Z","title":"PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00527","snapshot_observed_at":"2026-08-05T20:37:14.599574Z","title":"Polarquant: Leveraging polar transformation for efficient key cache quantization and decoding acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.599574Z"},"links":{"cited_paper":"/paper/2502.00527","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:b6c56530689d46ef93fcecea79b178464bc8bee602ccaf8bb0b191bdac5ce819","observation_id":"3720f747-8b2a-4343-9bae-c838fb1fd24c","resolution":{"observed_at":"2026-08-05T20:37:14.599574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.061367Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"722227b9-b890-4391-b43a-a37db567d3e8","year":null},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.615011Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:bb0bbab605c2bebe322e6cdd1b5a02cbef174902ca70e73dc11c8417381a02a3","observation_id":"15ecedfa-918c-4f51-bf87-f9124faf0059","resolution":{"observed_at":"2026-08-05T20:37:16.064850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:14.637536Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.637536Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:766b9de7e6fa316d958206e51243c52bd60f1085d47a75c0e52c525cbe81ad12","observation_id":"f5905c12-24a7-4e6a-b390-da8ece273cf7","resolution":{"observed_at":"2026-08-05T20:37:14.637536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:14.749127Z","title":"Recalkv: Low-rank kv cache compression via head reordering and offline calibration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.749127Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:e1913986344e49b3b05d5da535d5853773217f39fe3e941bdec05e46c0ecbdca","observation_id":"cef110ff-40c1-4fcc-b6d4-7d18d26e9899","resolution":{"observed_at":"2026-08-05T20:37:14.749127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.044896Z","title":"El- attention: Memory efficient lossless attention for generation","venue":null,"work_id":"7a4a17f5-2d4b-49de-a52b-5439e6501f81","year":2021},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:14.924191Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:b2b3031d89605573b298988f182617e993c4c61dd92c74ca4ea433e5cb3e9898","observation_id":"56482788-ff5a-4cc4-b718-e7969d227cea","resolution":{"observed_at":"2026-08-05T20:37:16.048265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:15.107048Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.107048Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:df07aa94ac72010e2d62de082aba4191c02cf7c41400be229d26465536038de1","observation_id":"c7653971-b57a-42d5-8ea4-c3692c18ec05","resolution":{"observed_at":"2026-08-05T20:37:15.107048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-16T14:14:39.490675Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-05T20:37:15.322633Z","title":"No token left behind: Reliable kv cache compression via importance-aware mixed precision quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.322633Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:a7216720f7d8d8bb64c7d9ddde14fd1ffa8c0b3fa1c68843cf0408b78fc87f57","observation_id":"45cd5222-97fa-4974-a33c-7dbc48f255f2","resolution":{"observed_at":"2026-08-05T20:37:15.322633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-16T14:15:25.301514Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T20:37:15.475893Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.475893Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:ebf876fd236df5fc1e1b2cf2d6a1841a303fb160bbf2522b2b274f4ddfedb295","observation_id":"84d11a4a-1084-4bf8-812f-086dfa615dee","resolution":{"observed_at":"2026-08-05T20:37:15.475893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.027273Z","title":"Root mean square layer normalization","venue":null,"work_id":"e590ed2a-b2bc-4f7c-8074-8f315d0b4cfd","year":2019},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.673100Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:5149ada9cbd732eafee0c35da22466cc6dfa0ff3834590e279690f2528e962b1","observation_id":"88e694ca-5ae1-49eb-acb9-af558ae55074","resolution":{"observed_at":"2026-08-05T20:37:16.031243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03111","last_updated":"2024-10-04T03:10:53Z","snapshot_observed_at":"2026-08-16T20:58:32.499929Z","submitted_at":"2024-10-04T03:10:53Z","title":"LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03111","snapshot_observed_at":"2026-08-05T20:37:15.716757Z","title":"Lorc: Low-rank compression for llms kv cache with a progressive compression strategy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.716757Z"},"links":{"cited_paper":"/paper/2410.03111","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:99349cdb0f13575ee676c387745abcb84a92cfac7cacd750f259a57a103824e4","observation_id":"594bfca9-8323-4366-8d46-5c149d425ec0","resolution":{"observed_at":"2026-08-05T20:37:15.716757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:37:16.016140Z","title":null,"venue":null,"work_id":"d075f50c-c768-4c08-9ec0-ae6d5b0bed0a","year":null},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.720135Z"},"links":{"citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:72b02b4e2cec4bcb99470ddc156e75e64c02b0af831d871b160502b49057ebdc","observation_id":"94d290ba-be83-46d2-a099-fdd937a0a2c2","resolution":{"observed_at":"2026-08-05T20:37:16.020486Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:30:32.868961Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2508.10395."}