{"as_of":"2026-08-09T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae14e559d058de95d607fa26c9a3817d64c3d20b9a29c67fd5d47ae5990f7582","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:02.274620Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:45:48.458849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:45:48.747511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"cited_work":{"arxiv_id":"2506.02572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02572","snapshot_observed_at":"2026-08-07T00:45:48.747511Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","venue":"cs.LG","work_id":"b281805c-434b-4b6f-8e01-cbc075af3219","year":2025},"citing_paper":{"arxiv_id":"2608.04405","last_updated":"2026-08-05T03:19:21Z","snapshot_observed_at":"2026-08-08T23:11:36.041523Z","submitted_at":"2026-08-05T03:19:21Z","title":"Training-Free Hashing-Based Attention via Binary Principal Components","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:45:48.458849Z"},"links":{"cited_paper":"/paper/2506.02572","citing_paper":"/paper/2608.04405"},"observation_digest":"sha256:34af1b28090a8c724a30cd23dd94b019111a01e4f0a01bf8b5035bafde82483e","observation_id":"8a1c847a-d352-4183-97c4-ee08663a825b","resolution":{"observed_at":"2026-08-07T00:45:48.754100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02572/citation-record","integrity":"/paper/2506.02572/integrity","json":"/paper/2506.02572/citation-record.json","paper":"/paper/2506.02572"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.349731Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.349731Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e75b5ce297df183141e52aadba694ab0db913f9a477fb107333662ffcb6542f3","observation_id":"d00d6d16-d450-434f-9c50-f55eeaeb2bb2","resolution":{"observed_at":"2026-08-07T11:25:57.349731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.459565Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.459565Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:999c363f708e77e7da9140277d30792c9370401987ea56e60a8c026b1fe60bf2","observation_id":"d0264211-adc8-4dcf-9e69-f46c3df0a536","resolution":{"observed_at":"2026-08-07T11:25:57.459565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.675401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.675401Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:69024992e72033db8e2a9c6f4a88b096ea6d9b3eb5c20309c7b264f27b83cc5c","observation_id":"28ab32b5-96e1-4cf7-8a59-a4db1e863739","resolution":{"observed_at":"2026-08-07T11:25:57.675401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.843590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.843590Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e133be6de669b6b76cc049a2b12b3e0fb81da47a3026c18649876b26919fd220","observation_id":"4ef753db-df26-4f3a-ad33-345fced6e436","resolution":{"observed_at":"2026-08-07T11:25:57.843590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T11:25:57.958618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.958618Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:6eabb2607a095f559f44a1eba52b4d53fbaa59a7475b28b5d38a7cf1322965ff","observation_id":"5258d014-ba2d-4a4b-b4e7-f30b0cc1acb1","resolution":{"observed_at":"2026-08-07T11:25:57.958618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-07T11:25:58.070396Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.070396Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:4d51f748b07ff20b904a3df00fae011a6159b0462f51d77a4e093d6de5fac78e","observation_id":"9867a5ec-f2d4-463f-bc37-ca11d9540298","resolution":{"observed_at":"2026-08-07T11:25:58.070396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T11:25:58.308531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.308531Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:75f3be4062f6d4900d203540c82a32de37fb3f6e7561f46b780b0684378b4add","observation_id":"a455538b-71a8-48d8-88b4-fa44995695e9","resolution":{"observed_at":"2026-08-07T11:25:58.308531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T11:25:58.446766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.446766Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:052b2a7b47d497cf6e8bea1e7187fc648c2c438fe894a70eb0cd5cb923fc0f8f","observation_id":"e84205aa-0633-4f08-9907-660047ea07d1","resolution":{"observed_at":"2026-08-07T11:25:58.446766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:58.692270Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.692270Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:7be44c78ed08979c352ca6b9fb3bb4ce2cde14062041aa66d3709eabee177941","observation_id":"0b527f51-05cf-4587-8bc5-3bf20c84f762","resolution":{"observed_at":"2026-08-07T11:25:58.692270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14468","last_updated":"2025-06-03T21:55:57Z","snapshot_observed_at":"2026-08-09T10:29:43.595399Z","submitted_at":"2024-12-19T02:34:15Z","title":"HashAttention: Semantic Sparsity for Faster Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14468","snapshot_observed_at":"2026-08-07T11:25:58.886175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.886175Z"},"links":{"cited_paper":"/paper/2412.14468","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:214b368ced6a30c1c1c90ee647301d29c9bd2ceb7e8e9be67b52712d65e7e2b0","observation_id":"ab5eca77-3f83-46e3-8a11-8324063aa0d8","resolution":{"observed_at":"2026-08-07T11:25:58.886175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.916272Z","title":null,"venue":null,"work_id":"8070b6d3-45a5-41e3-90ef-4b4ab06f5a5e","year":1999},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.049157Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:5009a7e0703f6aace39fca70c9918e64442875c758f74617001f36c152a26467","observation_id":"af753a9a-dbfa-4988-8115-d17d67229f61","resolution":{"observed_at":"2026-08-07T11:26:06.014550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06899","last_updated":"2021-06-13T02:30:23Z","snapshot_observed_at":"2026-08-08T01:15:11.346221Z","submitted_at":"2021-06-13T02:30:23Z","title":"Memory-efficient Transformers via Top-$k$ Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06899","snapshot_observed_at":"2026-08-07T11:25:59.218497Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.218497Z"},"links":{"cited_paper":"/paper/2106.06899","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:02cc70d8ff4157095f530a17996201321705dea644f664a4e21f06a458e2c12b","observation_id":"8629c365-fbe6-4024-9823-fe469e099adb","resolution":{"observed_at":"2026-08-07T11:25:59.218497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T11:25:59.316579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.316579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:dd3d5a60a769255f0059411bc49671db2e708c4b184cf7f371746c3d87703a01","observation_id":"19c23bce-5875-44f6-92fb-259f5d75ee64","resolution":{"observed_at":"2026-08-07T11:25:59.316579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T11:25:59.386831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.386831Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:aba4c2477fba6c342722d6963353b05e5af7dae0a8e8ca4c16edcae7a9e1f12c","observation_id":"98153a66-8728-42ce-93cd-e39469ce9dac","resolution":{"observed_at":"2026-08-07T11:25:59.386831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.659394Z","title":null,"venue":null,"work_id":"6ad2a32a-60f4-462a-b7b6-5b0b99aa6075","year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.455430Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:bfd9718cc1f05801ee97e7c1210b78d4c05d58295a86e2d23c968322d38c1d98","observation_id":"8f6999e4-445f-4533-874c-ec85146d0447","resolution":{"observed_at":"2026-08-07T11:26:05.794332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.465776Z","title":null,"venue":null,"work_id":"6f788081-8823-49f0-9b66-583f380cd2b8","year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.604558Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:10e530c5056a116d41c05d4cb2657f9610686ccdc651d9afb03af4abcba69982","observation_id":"1edc92a5-580a-4b71-85b4-741ef6a3ddd3","resolution":{"observed_at":"2026-08-07T11:26:05.546700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:59.706591Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.706591Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:eb8206ea6a2f5e6b08aba9de407f08bbcafa5204eed760d6f905089b4be8222e","observation_id":"02e562ac-2889-411f-b68f-268dde24cd2e","resolution":{"observed_at":"2026-08-07T11:25:59.706591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.247807Z","title":null,"venue":null,"work_id":"0534929b-145a-4d07-abfb-db6f5dfb824f","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.830867Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:acaf7cb5bfe3d881c530acbf17d06eb3319736eb5d981c414f5870c146d9d920","observation_id":"012433c7-92dc-48a1-aabe-e548db1efe5e","resolution":{"observed_at":"2026-08-07T11:26:05.347082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:59.949662Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.949662Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:fe39c194e24ea8a1bd2d71a974c6018082bfc5b922461cc0012391797c70cacf","observation_id":"37306390-c055-4a70-999b-5d757f92dd6c","resolution":{"observed_at":"2026-08-07T11:25:59.949662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:26:00.038860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.038860Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c7fcf3e9c56b38f35c0591448a5c407c899ff80e269746247db0f83b4ae9a622","observation_id":"098a8c1b-004e-4148-b148-d46686046608","resolution":{"observed_at":"2026-08-07T11:26:00.038860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T11:26:00.133693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.133693Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:8a80bc62f46a1a0d982f468f84d32c9ebfada60a4bb499adad1754ae28d61321","observation_id":"2b7360b8-110d-47b9-a140-000b9b0cab85","resolution":{"observed_at":"2026-08-07T11:26:00.133693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.029299Z","title":null,"venue":null,"work_id":"6ecaa95e-47b4-4324-bf79-862b310d2ac4","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.262542Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c84f562285af0259b96f0c07fb48ea24c42256af8680b25e65aff54b61146ea6","observation_id":"9117e012-3f1c-47d6-9b79-58783242eea5","resolution":{"observed_at":"2026-08-07T11:26:05.128766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.841103Z","title":null,"venue":null,"work_id":"05bf4512-2acb-4609-9a8f-7f5c8cfd2c69","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.355214Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e53b5fc46a07ead2ddb6a03dd0dcd13da1a515eb3f65734827b1ce382f8ead90","observation_id":"4d96180c-7e34-4588-b55a-2bb8ac645924","resolution":{"observed_at":"2026-08-07T11:26:04.945624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.600217Z","title":null,"venue":null,"work_id":"f0b47ab1-4f60-4dfd-89b8-82e5992ef3dd","year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.450652Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:5c210eecf073a863c30abc4468a1cca48aa55fa6f63eef64796b26299bcf539b","observation_id":"39d47bc8-9f11-4b4f-a4d5-29fc19b45eb6","resolution":{"observed_at":"2026-08-07T11:26:04.729592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-07T11:26:00.637951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.637951Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:48a6ddae57d1725ef7e1a0298489cf26f40ed731ca4d72964b09b8a6513f45e5","observation_id":"c9d52bb4-15be-4955-bc9d-3d23740d9950","resolution":{"observed_at":"2026-08-07T11:26:00.637951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:00.727994Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.727994Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:8d3ca2d16f70370d2bd76a641dc444ce360626c41a8881ada131e7d5a13a85a5","observation_id":"0e03dd71-908c-4e4f-a12d-e05dcd4523fe","resolution":{"observed_at":"2026-08-07T11:26:00.727994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-09T13:29:29.418787Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-07T11:26:00.797982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.797982Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:625721cc59b953b5fc53cfcff74f4db99fdc03cf4a8d338f59164fd7cbf9fd48","observation_id":"db9cac96-1645-4357-b4db-31300544deb0","resolution":{"observed_at":"2026-08-07T11:26:00.797982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-01T20:33:25.557711Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-07T11:26:00.895653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.895653Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:ac6639ecfede48290b9bb6e4c5a407c8aec61068630562f5fd434c57cee800c9","observation_id":"2178ee9d-6c7e-4b91-bb98-be1e9a5b5e6b","resolution":{"observed_at":"2026-08-07T11:26:00.895653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.370963Z","title":null,"venue":null,"work_id":"4dbeaf77-70d2-4dc8-b178-643fcb9edf7f","year":2021},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.047307Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:7e896d8beec6fa75b0d89bba836a02ed424b347c84bfdc45989658e541775a23","observation_id":"1537f08e-129f-4807-ac9a-fcca9ebf512d","resolution":{"observed_at":"2026-08-07T11:26:04.503621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T11:26:01.145607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.145607Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:40fd3d166a0a84e4533152afc845ba6551e64bf510b0db78bd73f587f5b6fbbb","observation_id":"f8c98f77-f5ad-4674-bfef-2c7c10eb8831","resolution":{"observed_at":"2026-08-07T11:26:01.145607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:01.299814Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.299814Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:0e520f16db592052bd1108afafa6a6cdd637a2861a67e2dc6f080398962ff064","observation_id":"42e625ea-5c24-45e6-899b-70ef97c44005","resolution":{"observed_at":"2026-08-07T11:26:01.299814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.202098Z","title":null,"venue":null,"work_id":"2d8c0e2e-7003-449f-a85f-e52585684f6b","year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.430394Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:0e3d295eef362bf011d6f54696e06f872963cf0b57998f139bed09ff613438a0","observation_id":"d50ea01c-306d-4f00-ad0e-a8fda0e12902","resolution":{"observed_at":"2026-08-07T11:26:04.278953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.955841Z","title":null,"venue":null,"work_id":"1435b5f9-0ffc-4394-8ddd-a36cf5587b5b","year":2012},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.499338Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c560b938540cbadf654b2464ce804b3c6faa9f199b603fc6687f1451f5c9a0aa","observation_id":"266518e8-ac32-4b3a-aa97-26293bc11f2a","resolution":{"observed_at":"2026-08-07T11:26:04.091956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.734909Z","title":null,"venue":null,"work_id":"f8fba1cf-a9c4-4eb2-937b-1539d53fe53c","year":2008},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.598450Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:82309a2a249b45c79ac0b8b49c94695aa21cadc0b0f2958a2f95d395a86f82ee","observation_id":"e3fd5a6e-c4bc-4898-9132-2d7c822408d2","resolution":{"observed_at":"2026-08-07T11:26:03.842301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.470084Z","title":null,"venue":null,"work_id":"196c971b-924a-4f08-9e52-d63cb1cf6d03","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.694965Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:705e9b56a3b7be2dfd182eb25864850db9b9674a4a113e941a8251eebd799f6d","observation_id":"536b9b5a-dd44-432e-93ed-2e855ea981e6","resolution":{"observed_at":"2026-08-07T11:26:03.625450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T11:26:01.762361Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.762361Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:918e583bbc5a2ae89690b3c657351a7e39393689f2fdee9cfd073d9793f7614f","observation_id":"aa457d13-4aa4-42e0-b74b-cda988a847f4","resolution":{"observed_at":"2026-08-07T11:26:01.762361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-07T11:26:01.860825Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.860825Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:7fadc18314a17d690b0cd08d9e646bbe146a28fe472fe91d038fcdda30a59b69","observation_id":"8438d211-1c14-4880-88be-6b85ebcf3437","resolution":{"observed_at":"2026-08-07T11:26:01.860825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.176519Z","title":null,"venue":null,"work_id":"b52fa05d-efee-4930-a4c5-0b65c28a89ad","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.933392Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e9bff48aacf0ce0c5a039c18f7ebc8dabad0b79e646c8287d6fb35aaffda7ed2","observation_id":"823f57db-0166-4562-9bd7-c85d58cb7e38","resolution":{"observed_at":"2026-08-07T11:26:03.351191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:02.944933Z","title":null,"venue":null,"work_id":"6856e6cc-d2bd-4354-83e9-7ea41eb98ab5","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.028935Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c61e1e92b2a07353e61f36703ae3ac45a4cd56d5fe8ecece585e15353d0fb95c","observation_id":"99128bbc-79ff-452d-8e15-744b868cf3bf","resolution":{"observed_at":"2026-08-07T11:26:03.056187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:02.643857Z","title":null,"venue":null,"work_id":"1862dfdb-bd01-46f8-957d-4244fe4df7d2","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.149538Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:8cc4979ad13c4382fae777e6c5884783b3d3f8ef39264d39605a48eae92d4272","observation_id":"06830067-bf8d-4a76-ac42-edd18430f3f6","resolution":{"observed_at":"2026-08-07T11:26:02.786954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T11:26:02.274620Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.274620Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:22aea64f67500ccd5b1b8aa6dfd1d4fb4f2b32f1152cbafefdd7d361f77acdb0","observation_id":"baecab88-b21b-4b40-ab88-44eae0a1654e","resolution":{"observed_at":"2026-08-07T11:26:02.274620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:46:21.801125Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.02572."}