{"as_of":"2026-08-10T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ca2f23f3c4808789bffc9f09ca86e2b7b0729a23b14cc14e17be478a015a16d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:43:26.657972Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17787/citation-record","integrity":"/paper/2505.17787/integrity","json":"/paper/2505.17787/citation-record.json","paper":"/paper/2505.17787"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.09259","last_updated":"2023-11-02T14:26:57Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T17:15:05Z","title":"QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09259","snapshot_observed_at":"2026-08-07T14:43:23.877823Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:23.877823Z"},"links":{"cited_paper":"/paper/2310.09259","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:472d11318f20de76bd623b820454c51b53f366235b75a61c0544e498ff860cc3","observation_id":"561a2594-52b9-46dd-8a6f-22701e488092","resolution":{"observed_at":"2026-08-07T14:43:23.877823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21259","last_updated":"2025-02-28T17:35:14Z","snapshot_observed_at":"2026-08-09T08:06:14.128871Z","submitted_at":"2025-02-28T17:35:14Z","title":"Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips","version":1},"cited_work":{"arxiv_id":"2502.21259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.21259","snapshot_observed_at":"2026-08-07T14:43:27.208890Z","title":"Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips","venue":"cs.AR","work_id":"993a0716-530a-428e-a278-50f5c8a91a78","year":2025},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:23.942576Z"},"links":{"cited_paper":"/paper/2502.21259","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:516766dfe1342ee1e4541c48b299adbb7ad4ae4c815ece3e8de61bf9d13ed52e","observation_id":"2f64061e-f78b-47ea-9f73-d6791272b5d1","resolution":{"observed_at":"2026-08-07T14:43:27.277510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.789590Z","title":null,"venue":null,"work_id":"fa132fc6-99b9-423a-a288-c226e7adda21","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.039824Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:550609e6e8df30031cf22f4ac820f67bc3447e943badbd2dfa7d10a1c5037879","observation_id":"b42d80e2-e522-4e49-bb9f-1aa1535408d0","resolution":{"observed_at":"2026-08-07T14:43:31.936899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.515465Z","title":null,"venue":null,"work_id":"3562c9fe-80cc-43e3-aafe-a1c191b68c60","year":2002},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.110700Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:695db58ebbe1ba632dbdad5a55d32f6f5d319e4ab5edd2878e913747c7c8879d","observation_id":"6a184e9b-7bba-49ef-8b5a-32f8dbcbee78","resolution":{"observed_at":"2026-08-07T14:43:31.635460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.282652Z","title":null,"venue":null,"work_id":"a16e1d14-0720-41d2-b0fa-bd82b373785c","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.161475Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:58693bb401d4f9143f5a75ec50c13e90b3a566b91cde20fb8af628a82c79861e","observation_id":"ddbea822-a18c-4fd6-95f5-2f8eb180d89a","resolution":{"observed_at":"2026-08-07T14:43:31.396927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-07T14:43:24.234222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.234222Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:056a547d6a0bf18f7aa8ea96eedb41b2b77d72a1d6f02c8008fa7ed9c4818cf1","observation_id":"241ba12b-38b3-44e0-975b-b543ce66e8a2","resolution":{"observed_at":"2026-08-07T14:43:24.234222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:31.046467Z","title":null,"venue":null,"work_id":"c5ca9ddf-6a6f-464f-b27e-bddde50aae0c","year":2020},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.324465Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:6d65db86630da216fff64352ff04ea6d3310e8ec24f2736aba776e41cc2788f6","observation_id":"a1c51d3d-3c4c-4263-a874-0e0ece0aea54","resolution":{"observed_at":"2026-08-07T14:43:31.160358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.822809Z","title":null,"venue":null,"work_id":"0ae1e920-8ffa-4611-8f62-a61028b28ea2","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.395816Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:e8f78b5698809766f3d8cc010f59382e08acdbdee305eef0131763bd21bcb485","observation_id":"83d7cedf-b6b7-46ed-aa55-27a68c486a08","resolution":{"observed_at":"2026-08-07T14:43:30.923499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T14:43:24.481761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.481761Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:9abc1fcd2e972f636c4a7e387ff09f2dc18e1052a5fa9bd50b3aca6ea74d884a","observation_id":"626ad239-cb82-4223-92e2-612a9d4ef34a","resolution":{"observed_at":"2026-08-07T14:43:24.481761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08391","last_updated":"2024-10-10T21:55:11Z","snapshot_observed_at":"2026-07-06T19:31:31.809692Z","submitted_at":"2024-10-10T21:55:11Z","title":"KV Prediction for Improved Time to First Token","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08391","snapshot_observed_at":"2026-08-07T14:43:24.538615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.538615Z"},"links":{"cited_paper":"/paper/2410.08391","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:cf217660bf114821ee52f095bf2ad816800f1bf7ba7dbb7f26d76375377a09e3","observation_id":"cf9ed798-cd90-4e1d-a68d-a47f2fc04aff","resolution":{"observed_at":"2026-08-07T14:43:24.538615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:24.611567Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.611567Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:0174d65a7d300fb09e6360e148da800124d7c9025b813c044f5ab9f69310301f","observation_id":"2ab19418-e60c-41b5-ad3d-55ced89406bd","resolution":{"observed_at":"2026-08-07T14:43:24.611567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.548665Z","title":null,"venue":null,"work_id":"8a4cdc68-0c96-481c-a5e4-20232f41977b","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.687006Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:de75c84ef15111d726614113ae687d5c09dcd956c9f137b99a95b392895447cb","observation_id":"d66e8fae-65ff-4ff7-929c-bc0181c6f516","resolution":{"observed_at":"2026-08-07T14:43:30.660504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T14:43:24.737825Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.737825Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:d6a3e77c28d6b8c682668451c24a7941cac99089b0b7e973e656acec25798728","observation_id":"9994723e-e003-4489-a9e0-19fbd2093c5c","resolution":{"observed_at":"2026-08-07T14:43:24.737825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T14:43:24.804107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.804107Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:54292a2eba564e23df028f2c5178ad5fd98b01fe30882aaafdb92c3b2d690053","observation_id":"81218080-6259-443c-96da-4eb6a9e4563e","resolution":{"observed_at":"2026-08-07T14:43:24.804107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00907","last_updated":"2024-10-02T15:34:12Z","snapshot_observed_at":"2026-07-06T19:25:28.300272Z","submitted_at":"2024-10-01T17:53:28Z","title":"Addition is All You Need for Energy-efficient Language Models","version":2},"cited_work":{"arxiv_id":"2410.00907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00907","snapshot_observed_at":"2026-08-07T14:43:26.899448Z","title":"Addition is All You Need for Energy-efficient Language Models","venue":"cs.CL","work_id":"68dbcd45-7962-4528-9d82-229c9fa58d9d","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.884943Z"},"links":{"cited_paper":"/paper/2410.00907","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:ba34a6e49a574184a4957f9aad223108028fc0659308c99527d0eb24a7928255","observation_id":"bc17d69f-6bfc-4177-a896-ceacabeb714e","resolution":{"observed_at":"2026-08-07T14:43:26.968577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.331009Z","title":null,"venue":null,"work_id":"0363c42e-dd12-4550-a4d9-f25dadd1ad40","year":2009},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.962401Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:49afbe452df3a3817ca74a6fb554f484367a3b87a09602b3dbb7790fc04daa7e","observation_id":"699f1c02-d1a9-42dd-8a55-39c907d87efa","resolution":{"observed_at":"2026-08-07T14:43:30.425303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-07T14:43:25.057858Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.057858Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:7eebb0b3f68e5e37f101c9c25d1d8b18c227e84f94a2f991562bd6b0a9845798","observation_id":"250c1624-1a87-499a-8bc5-06cda2c4c6d6","resolution":{"observed_at":"2026-08-07T14:43:25.057858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:30.069334Z","title":null,"venue":null,"work_id":"d59bed77-5542-4d05-977b-9cb4267e92c6","year":2015},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.100835Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:1b8664d3d7c77408b1d2a3c15cad6916682477e1de6c8e6082e3f2ecbfc6aab5","observation_id":"ad2999bc-5683-4649-8326-1a35682ab888","resolution":{"observed_at":"2026-08-07T14:43:30.193697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.878118Z","title":null,"venue":null,"work_id":"3d472138-af83-46af-bc7d-d2f538b33d0a","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.191669Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:ba1ce9016114eb0ea1981e191c4b9509a46934e28356770bb571def4d10c509e","observation_id":"23a6d20a-d763-49f8-b7b3-f1e7122ffad6","resolution":{"observed_at":"2026-08-07T14:43:29.968288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-07T14:43:25.278890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.278890Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:315508b37cef8f8219d842b3669f4fb17b13740c79522f6d2c8b2cb9f09e462f","observation_id":"e98d8f9a-d375-4af1-b99f-d0bce2c45af4","resolution":{"observed_at":"2026-08-07T14:43:25.278890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.627504Z","title":null,"venue":null,"work_id":"f8d83fea-7862-496d-b48d-631a00ca9b9f","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.353835Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:c648e76b51741a709548a85a0d4c886bee8f024d12c604129ac1d6be1b3e8ed3","observation_id":"07643cca-4ef2-4cbd-8649-a3a3b02299e0","resolution":{"observed_at":"2026-08-07T14:43:29.717204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.431827Z","title":null,"venue":null,"work_id":"21bd8945-f3f3-4cb4-8024-5456f7600b66","year":2017},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.443295Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:bad043b1d7cf70ced1bd38d103c1c94aae70d2eedf36af45ea04c490dac3a322","observation_id":"2fa4ab26-ac34-41b1-bd3d-0635aa8916f6","resolution":{"observed_at":"2026-08-07T14:43:29.513676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.260478Z","title":null,"venue":null,"work_id":"8ea8a0a7-7729-42bc-9861-8575ac8a043f","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.517443Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:48a2cad3a0e41977c7e41dd79da4b08bab058ba0b940670f1bb8949ad58490fd","observation_id":"81eefca8-b57a-4ed4-a735-622195e74359","resolution":{"observed_at":"2026-08-07T14:43:29.337818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:29.119515Z","title":null,"venue":null,"work_id":"5a014a04-50ae-43e4-b380-79aadeb80930","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.550282Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:f565f347d95acabf1df92e409de97260215e5dc78c561862f7154724ec6807b8","observation_id":"58ffa4c2-4bab-43d1-8950-f7c836236800","resolution":{"observed_at":"2026-08-07T14:43:29.190460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.937597Z","title":null,"venue":null,"work_id":"d6ba6579-99bf-4fbc-a93d-eeb662ca7a8f","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.638413Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:38820e1e34fc417c3a9425bfd1ef0e4009ddc4df83f818a1f290853b89d8462d","observation_id":"fdeef3c6-7d87-40eb-ab28-a2b3ca2a5955","resolution":{"observed_at":"2026-08-07T14:43:29.026897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.774908Z","title":null,"venue":null,"work_id":"89bde62a-44e8-4275-855f-485e160a2625","year":2019},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.723605Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:a5ca6432046069b963babf2a88ec4c4538558cf2adf269d2f87292e58933c820","observation_id":"d511cb77-3f21-43e5-b2a3-eabe8d4af8a9","resolution":{"observed_at":"2026-08-07T14:43:28.845187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.647410Z","title":null,"venue":null,"work_id":"f3d6000f-97ac-4db9-a092-28928e2ac772","year":2021},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.802538Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:9abc149bf1998672ece36fbace6d29e1a62889f43fae43a90521252b9b29a002","observation_id":"67421942-2deb-4a80-995f-add295af4af8","resolution":{"observed_at":"2026-08-07T14:43:28.701804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.505651Z","title":null,"venue":null,"work_id":"4abfd444-1041-4b1d-94ea-d367ffa59667","year":2017},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.887573Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:43dbfddf8d90157459935800a8d47bad55271f7ab8e768337565799fae442e3b","observation_id":"41e95834-93a5-4a6c-839f-8d9e3b60c4d2","resolution":{"observed_at":"2026-08-07T14:43:28.555081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.346552Z","title":null,"venue":null,"work_id":"847807e7-957f-4172-8872-23e62f586d21","year":2023},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:25.963396Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:bb873388458c78c9c085b4965cb2476fa6332672afc6b1c32e021c7d9baacf51","observation_id":"6b6f1283-a928-425c-9934-c178e5b2c5e8","resolution":{"observed_at":"2026-08-07T14:43:28.437439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-09T12:45:38.058315Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-07T14:43:26.032859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.032859Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:31b75f91c07e48268cc61c2d28c9a9ba23b07860cdfcf6ebb4e3d247782fb554","observation_id":"f7b6bb84-7f31-4437-9796-8233bc028077","resolution":{"observed_at":"2026-08-07T14:43:26.032859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:28.134252Z","title":null,"venue":null,"work_id":"c3d08951-b53f-4323-9158-580da602cdce","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.109407Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:3f769756001376159bcac1a597ba7e108b86bfd876216034e675d83323d94288","observation_id":"61ec1d3a-11ca-4ca6-aeee-4d9893304a55","resolution":{"observed_at":"2026-08-07T14:43:28.232862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.990617Z","title":null,"venue":null,"work_id":"d6091ada-2ade-46cf-bb2b-ccd65c9323b9","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.187914Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:21b87562cc7db24ef3053c5294ad00a4211d25ccdafe4dcf3036fcf73ac62c38","observation_id":"f138160f-1de5-4c85-a283-2d7300b06fc9","resolution":{"observed_at":"2026-08-07T14:43:28.035037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.809896Z","title":null,"venue":null,"work_id":"11f2bc78-3dc7-4485-bb1f-52f145b24115","year":2020},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.262607Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:308aa835c25fcb978b98573bfa07d974e1a019c246caa3ec9525717fcb94ecd4","observation_id":"235865e1-0480-4074-bfe2-2f887d621b60","resolution":{"observed_at":"2026-08-07T14:43:27.880457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.699666Z","title":null,"venue":null,"work_id":"f84c94bc-dab0-47f9-beff-8f8add922a59","year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.354391Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:dbb65b1df5790e97947b7e19691a3988a70fc8288695ccd025c559d7be6a4ee0","observation_id":"f98220bc-9151-42b5-8478-f8cee8cc6b7b","resolution":{"observed_at":"2026-08-07T14:43:27.739880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.553502Z","title":null,"venue":null,"work_id":"31f992a8-482e-4f80-b37a-62d312b5e2a9","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.435277Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:aea5bd5234ef13c50441063e1c73e72147f8caf099e46483d2a5b648fb6827ff","observation_id":"c9c4e108-3d06-4227-b163-0ca88d906369","resolution":{"observed_at":"2026-08-07T14:43:27.627494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:43:27.393415Z","title":null,"venue":null,"work_id":"923ebd12-63bd-47c9-8143-7806a031d56e","year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.533443Z"},"links":{"citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:e646eadee1b035bc1c44fc942a7350162d14f8150993ebcb8fcf77e1084683f8","observation_id":"9f0fd63f-07fb-4556-9421-06af70a1bb8a","resolution":{"observed_at":"2026-08-07T14:43:27.459640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T14:43:26.657972Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:26.657972Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:d39d292f256f0eb0d51bd698007fba983d2ccf5c644906d5981ce78959d09da3","observation_id":"a8cf7b4b-d36c-4e34-baf9-8f9d1ef77f31","resolution":{"observed_at":"2026-08-07T14:43:26.657972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-09T08:05:54.380340Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2505.17787."}