{"as_of":"2026-08-20T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:783edcd2fff6c20a036c51fb0f5446794192eccdfe2e15d4ef2466a1489d67c8","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:23:11.429005Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:06:53.318182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:55:35.129021Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2507.03153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03153","snapshot_observed_at":"2026-07-01T08:55:35.129021Z","title":"HGCA: Hybrid GPU-CPU attention for long context LLM inference","venue":null,"work_id":"c2aa954c-9295-4b5d-926b-093e39a63a0c","year":2025},"citing_paper":{"arxiv_id":"2605.07719","last_updated":"2026-05-08T13:24:39Z","snapshot_observed_at":"2026-08-15T00:27:43.410921Z","submitted_at":"2026-05-08T13:24:39Z","title":"An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:28.828593Z"},"links":{"cited_paper":"/paper/2507.03153","citing_paper":"/paper/2605.07719"},"observation_digest":"sha256:8959eabcecdd50bf9e7af2f9a38d70339b3fe765ebfcf37ce90f9e5fa36eb640","observation_id":"40b19ae0-e370-40bd-b243-539118cd83c6","resolution":{"observed_at":"2026-05-11T03:05:54.167753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2507.03153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03153","snapshot_observed_at":"2026-07-01T08:55:35.129021Z","title":"HGCA: Hybrid GPU-CPU attention for long context LLM inference","venue":null,"work_id":"c2aa954c-9295-4b5d-926b-093e39a63a0c","year":2025},"citing_paper":{"arxiv_id":"2605.11335","last_updated":"2026-05-11T23:41:16Z","snapshot_observed_at":"2026-08-15T10:58:40.771886Z","submitted_at":"2026-05-11T23:41:16Z","title":"ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:23:46.931949Z"},"links":{"cited_paper":"/paper/2507.03153","citing_paper":"/paper/2605.11335"},"observation_digest":"sha256:c92bac28f4dfc04ebea7e538eb5e08ef7357ac2500f78cc4c3b88d168d9e7e9e","observation_id":"c2597739-d9ed-4c33-b905-30feae5dc31f","resolution":{"observed_at":"2026-05-13T01:27:02.584535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2507.03153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03153","snapshot_observed_at":"2026-07-01T08:55:35.129021Z","title":"HGCA: Hybrid GPU-CPU attention for long context LLM inference","venue":null,"work_id":"c2aa954c-9295-4b5d-926b-093e39a63a0c","year":2025},"citing_paper":{"arxiv_id":"2606.29708","last_updated":"2026-06-30T03:13:37Z","snapshot_observed_at":"2026-08-16T06:58:23.021208Z","submitted_at":"2026-06-29T02:24:13Z","title":"Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T05:37:13.211613Z"},"links":{"cited_paper":"/paper/2507.03153","citing_paper":"/paper/2606.29708"},"observation_digest":"sha256:6d2938f926e8068f3edf90ee56fa01a093d7575680f5ebf727e53d949d16f687","observation_id":"f74a384a-6f6a-4d7f-82a1-563ce4dd2dd2","resolution":{"observed_at":"2026-06-30T14:04:45.301914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2507.03153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03153","snapshot_observed_at":"2026-07-01T08:55:35.129021Z","title":"HGCA: Hybrid GPU-CPU attention for long context LLM inference","venue":null,"work_id":"c2aa954c-9295-4b5d-926b-093e39a63a0c","year":2025},"citing_paper":{"arxiv_id":"2606.29708","last_updated":"2026-06-30T03:13:37Z","snapshot_observed_at":"2026-08-16T06:58:23.021208Z","submitted_at":"2026-06-29T02:24:13Z","title":"Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T07:06:53.318182Z"},"links":{"cited_paper":"/paper/2507.03153","citing_paper":"/paper/2606.29708"},"observation_digest":"sha256:316a987f2a781cf4190b4f7d5147c17deab2a05129a18eef0a095208accb3b19","observation_id":"306398cd-4251-4152-b2c4-6f9056b11667","resolution":{"observed_at":"2026-07-01T08:55:35.130368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03153/citation-record","integrity":"/paper/2507.03153/integrity","json":"/paper/2507.03153/citation-record.json","paper":"/paper/2507.03153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:15.231865Z","title":null,"venue":null,"work_id":"c3c670cd-81d4-4301-b307-c7f645306638","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:06.495867Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a50a5095adeeff9e11d238bd1ce9396e256c42b23af73b9441ee8dcd0e55a77c","observation_id":"283541c0-7eae-45bd-94b7-ec057d567d2a","resolution":{"observed_at":"2026-08-06T20:23:15.328653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-06T20:23:06.616998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:06.616998Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:0153c98ef538791c28a69bbc8440d84736f63ba76e8371b8e587389011f71f1d","observation_id":"b596e2d0-6399-4cf9-a0de-0c5b61b62bd6","resolution":{"observed_at":"2026-08-06T20:23:06.616998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T20:23:06.773480Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:06.773480Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:7ad3b4433c65645d37f7e08dc9ddadc2c52dc5bc708dd7abf927715ba08d50b0","observation_id":"3d9f2aa4-a207-4c12-9005-4d935434b456","resolution":{"observed_at":"2026-08-06T20:23:06.773480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-06T20:23:06.929626Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:06.929626Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:ae5718c439f12224201b15982272fe18ed636dcaa0b30f51b1e3473045a2a324","observation_id":"4dc6f1ec-f1bd-48fc-909b-5a8d15a18bba","resolution":{"observed_at":"2026-08-06T20:23:06.929626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:15.140422Z","title":null,"venue":null,"work_id":"4e0a71d2-7db0-4302-8955-201d67937f7f","year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.055162Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:24f4c4b41e95d49c6d51030c5d7da24a4d2df8f962bc0ea5caebb0ccd27410fd","observation_id":"4c16654e-8ea8-45e1-93e7-fe4bfd9029f7","resolution":{"observed_at":"2026-08-06T20:23:15.172036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:07.305255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.305255Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:040c47af66d104e41ac17cb7af7d9c0b947fd3afe93ccebb7eb98dba0b814102","observation_id":"b58bdb54-51f7-452a-9701-6a74709b43ac","resolution":{"observed_at":"2026-08-06T20:23:07.305255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.956367Z","title":null,"venue":null,"work_id":"6276d06e-e3c8-4ca5-9d92-0d7a4c803340","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.554340Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:ce34bb29167eef04888bd8c800a322a8e77360881ec64a3b3d196da1a0bf7edb","observation_id":"4d79de82-e945-491d-b9ae-c7fa6d4d4158","resolution":{"observed_at":"2026-08-06T20:23:15.020570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.809389Z","title":null,"venue":null,"work_id":"52a1b850-ff8d-4b71-88a4-115da18e0cae","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.611925Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:07728f9024b34d77d99a62a891429b015617133cb98660afa083f4941dd37b88","observation_id":"baaaabff-b972-4e5e-b815-5aec8ec9e06b","resolution":{"observed_at":"2026-08-06T20:23:14.887903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.678428Z","title":"2024.{Cost- Efficient} large language model serving for multi-turn conversations with{CachedAttention}","venue":null,"work_id":"14bba526-e5a7-4af8-901d-a4ddd83e7970","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.676775Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:6e40071e50ec07c9a2d4b01aa0718d806594f1d8d1e9638bc3d67e8be4d829ba","observation_id":"a3bcea62-8d5c-458c-942f-7e698426e0d6","resolution":{"observed_at":"2026-08-06T20:23:14.740866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-20T18:20:17.447831Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-06T20:23:07.738948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.738948Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:46efa968e57f1538bf6888a191050f8be8fb3fc3cfb5059c4a35a793c2ec513c","observation_id":"a4f8178d-b21c-4288-bb66-550d6a64f86f","resolution":{"observed_at":"2026-08-06T20:23:07.738948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-06T20:23:07.805883Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.805883Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a498dcff77e6bf1453c04c8bf99da40ac375b866e3c95f30f1053d9acef0c9dd","observation_id":"51290079-dd5d-49e2-becb-197b6672b7bb","resolution":{"observed_at":"2026-08-06T20:23:07.805883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:07.892996Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.892996Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:af7c245f87014ac684a983a6fd9c0b9b23f1d7a12ec87b82a564225c66dcd94c","observation_id":"f005e9bb-00fd-43ba-ae2e-564e9bfdc5a8","resolution":{"observed_at":"2026-08-06T20:23:07.892996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.471046Z","title":null,"venue":null,"work_id":"a1d6beaa-157b-4710-b01c-26bedd7198c4","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.044730Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:73b33ed258ef0e5cd45a3a35c900042cea5640e461d0ffb6b8f59ac425feea2f","observation_id":"673f8366-0a7c-4916-8c3e-704d82699165","resolution":{"observed_at":"2026-08-06T20:23:14.551089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.321554Z","title":null,"venue":null,"work_id":"29f94f72-8377-4832-a51d-0f7518ec6511","year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.111084Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:9a4a6bcfaf376ada28ec4d517cd3ebc926972b3e199e7b3a34657e2e5d79e371","observation_id":"8e17e11e-569d-4aa1-8c22-918e25924b4a","resolution":{"observed_at":"2026-08-06T20:23:14.388386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:08.199783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.199783Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:83f103ee6f73267f11bf0e92714d475044bf86493215cb88aa0aa30c1ea8749d","observation_id":"821624bc-6404-49cd-beb8-71168644d3a4","resolution":{"observed_at":"2026-08-06T20:23:08.199783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:08.356733Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.356733Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:bc691af6fc5c17a7c635b099c38601b60c6bb4751061cd12bec6585bf56dc71a","observation_id":"a88891cc-7e72-4ad8-b2bc-9b95e0e3169c","resolution":{"observed_at":"2026-08-06T20:23:08.356733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.084058Z","title":null,"venue":null,"work_id":"6186eb3b-14da-4739-b129-08547c38c39d","year":2021},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.450785Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:4d49e07bc6331014f8d7f9cb9fb79551ee240ca8a90f7ab12394080cb5034223","observation_id":"9f95e3c7-396e-45e7-a18c-415c57366bd0","resolution":{"observed_at":"2026-08-06T20:23:14.151458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-06T20:23:08.546761Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.546761Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:c180328232f16e4c2ea4ba997a9f5a5e9e96d2855d3b10d8269b6ca71e050f34","observation_id":"0ddab3eb-4b04-4d4b-86dd-934d3b0a6c6a","resolution":{"observed_at":"2026-08-06T20:23:08.546761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:14.205955Z","title":"Advances in Neural Information Processing Systems 37 (2024), 22947– 22970","venue":null,"work_id":"dff490f1-39d4-403a-8a0c-3798ac6a5fd2","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.289775Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:d54416313ec1043f65c259508bb82ba7df0ceebc3cfdb35ed378ea6a2440e8a9","observation_id":"1bde7af9-e12f-464e-940f-a70578758c78","resolution":{"observed_at":"2026-08-06T20:23:14.260718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:08.724360Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.724360Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:13e23f95f156122dd997020717dd63f320c8a0c9553ef0dc9d04724d42228ccb","observation_id":"4cfc5cd7-ebf8-4bf4-91fb-20b43ebd3780","resolution":{"observed_at":"2026-08-06T20:23:08.724360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T20:23:08.922591Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.922591Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:1349741b36f4a7cf2f9d13075b223f036d1d6ca313488fe726387f71127b5fc9","observation_id":"dd570bcb-6f0c-45d5-9dd8-8bc3a5fab274","resolution":{"observed_at":"2026-08-06T20:23:08.922591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-16T13:20:27.798332Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-06T20:23:08.996865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.996865Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:34cc17d25d23d5fe4ad380b387fdf7fb13fda9e69a66fa281f75b3c976b2cc20","observation_id":"a6a83586-5834-405a-a6b6-f5e81933883a","resolution":{"observed_at":"2026-08-06T20:23:08.996865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12574","last_updated":"2025-02-18T06:26:05Z","snapshot_observed_at":"2026-08-16T12:57:27.154019Z","submitted_at":"2025-02-18T06:26:05Z","title":"HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12574","snapshot_observed_at":"2026-08-06T20:23:08.655628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.655628Z"},"links":{"cited_paper":"/paper/2502.12574","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:20ca8021520f3c2e20bd3fb8f9a71ad66739c1caf01c3bd445f20be413b57286","observation_id":"73b00083-ebe0-4ad6-b566-9c8e9e4d6279","resolution":{"observed_at":"2026-08-06T20:23:08.655628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04437","last_updated":"2025-01-29T04:10:41Z","snapshot_observed_at":"2026-08-18T11:18:23.884084Z","submitted_at":"2024-05-07T16:00:32Z","title":"vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04437","snapshot_observed_at":"2026-08-06T20:23:09.183968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.183968Z"},"links":{"cited_paper":"/paper/2405.04437","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a9842fefaf9ef989ca82193a2890883e6121136d9edaf5f2d0f3588c82373a7d","observation_id":"5cdbeddd-2d21-4162-aa5f-5982cab441b1","resolution":{"observed_at":"2026-08-06T20:23:09.183968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.867720Z","title":null,"venue":null,"work_id":"42101429-cb1c-475a-8f97-fb5e0f70b53a","year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.287184Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a5a9c541a70d286d1ca583f1ad9eb105776c8d9adeb7eef4e55eb4fe2d1e32aa","observation_id":"fbb6a93f-78c8-48a2-af27-994cb7722caf","resolution":{"observed_at":"2026-08-06T20:23:13.924966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T20:23:09.372823Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.372823Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:9db38393555efa90e73c5cf7e996182a04f729d9905687b915ac0986c2b092c9","observation_id":"cdcfa3c6-f8c5-4f3a-b2cf-7f7d0504f755","resolution":{"observed_at":"2026-08-06T20:23:09.372823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.700309Z","title":null,"venue":null,"work_id":"26db434f-9355-4334-bbc5-7c1755a3f659","year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.449443Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:9f0f320b8e5d9e8235afa058a77491c6bed52b3197ae2516458410c61b3a554e","observation_id":"37b0486f-032e-4737-905f-db21fa971db7","resolution":{"observed_at":"2026-08-06T20:23:13.789727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.983032Z","title":null,"venue":null,"work_id":"b068dc2a-749c-4146-9a81-679f8219508c","year":2020},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.083238Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a31f49a6c912f3273f6853f89b60bbc05b3139497607f8adb74ec88417e93289","observation_id":"8d5ada3d-7956-4b8f-a0e9-bab06d28c0a3","resolution":{"observed_at":"2026-08-06T20:23:14.023156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-19T19:59:53.494904Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-06T20:23:09.634676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.634676Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:0c33562aed562a6a9595ad8ea4b051f9112a4670b391a5ed4342dcb299fbbec3","observation_id":"fa13dd56-c45f-45b3-9124-c34322e448b1","resolution":{"observed_at":"2026-08-06T20:23:09.634676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:23:09.715033Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.715033Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:0887ad2e728afa27a9b6aca0faf0691fdf61fd6f94aa36f77d38216722f0a2e9","observation_id":"b87760f9-9b4d-4089-8ba3-851c6ef17fc6","resolution":{"observed_at":"2026-08-06T20:23:09.715033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-08-19T22:31:41.606680Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-06T20:23:09.786594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.786594Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:ef46efab673d0e24954ed371895fb94731f1bb1c15cba04bf4af03a91c335282","observation_id":"07f4e39e-5f34-4aae-a0e3-33f962a8c334","resolution":{"observed_at":"2026-08-06T20:23:09.786594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.870644Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.870644Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:1163cab276bed28703033132c0e19ff9abb33939991e94d7e0aa3ce13f473223","observation_id":"b02aaafc-504c-4ac7-a1b7-fdee5b54e97c","resolution":{"observed_at":"2026-08-06T20:23:09.870644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.511802Z","title":null,"venue":null,"work_id":"5c6f41ed-0de9-4c0a-9914-9c6aa3269232","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.526833Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:c59a12ae9c5130f5e387bff67dd0967b3d9d05e172d3d960704636824f6a3118","observation_id":"7d142924-a365-45e9-9f08-d8cdae1f92f4","resolution":{"observed_at":"2026-08-06T20:23:13.611617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T20:23:10.042409Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.042409Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:a9c6ec02dfe11019613c74d1afb150191d625d34270867cc1cec3497d03a50a1","observation_id":"30d3ef68-2644-49ff-86db-2a3f9113d671","resolution":{"observed_at":"2026-08-06T20:23:10.042409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-08-16T12:48:10.527009Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-06T20:23:10.145162Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.145162Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:62fda2d6c00a0f76d1a572a5e8876a16ddf19b5dfe0b7a59cf6aceb4d7b29051","observation_id":"ca89c058-e067-484c-a479-72a3b1eb8b75","resolution":{"observed_at":"2026-08-06T20:23:10.145162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.345483Z","title":null,"venue":null,"work_id":"f5cd28c8-1a01-4ff5-b0ee-9a8fe8ccf622","year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.248132Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:10eec84b3d837c2a232f52b74d9307c176953f72a2eeaf877988840f6bd3242a","observation_id":"ce532b92-7fce-410b-84e2-38f491b37009","resolution":{"observed_at":"2026-08-06T20:23:13.433429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:13.118049Z","title":null,"venue":null,"work_id":"b7a1c1a1-f140-44b4-ab55-4f07cbbc5b76","year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.351457Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:ea8aa8f64546020ed5e7b384f8bfc4165e171537d9dcd261d08443383e5d61ec","observation_id":"1b89ed75-3b16-4829-bdb5-889e414fcf96","resolution":{"observed_at":"2026-08-06T20:23:13.221464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T20:23:09.940130Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:09.940130Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:9f3f7090f56a25fe3bd8c1c77455c5fc9a30c1948cd5fc4450773da13d4fa168","observation_id":"30b42c94-a547-4810-941f-147bf261f7ce","resolution":{"observed_at":"2026-08-06T20:23:09.940130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.715409Z","title":null,"venue":null,"work_id":"ef52203d-5540-4dc1-a0ab-5b3407f37590","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.538778Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:59c991f3c4d5caa83ef9dea10837327a76da04282dd85876a397d3ac649454b4","observation_id":"23595a6e-6812-41cf-bb8e-053175fa418d","resolution":{"observed_at":"2026-08-06T20:23:12.833036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.508794Z","title":null,"venue":null,"work_id":"d9109e1b-4e79-4b7c-a17f-eaae5cfc966a","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.679923Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:4d6e951f1a4913493f9b065ffe30799dbb51830cfe3a66165b50bc18c857f378","observation_id":"379f6667-7c1b-4af3-a2aa-8d206fe92ad7","resolution":{"observed_at":"2026-08-06T20:23:12.594045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-06T20:23:10.761186Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.761186Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:fabd58a27849ce4dfc5b8a5c94f42d79a1b32e498ad711e451a70807ff5b3b7f","observation_id":"bd63e885-b224-42e4-9093-0fa42a612a38","resolution":{"observed_at":"2026-08-06T20:23:10.761186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.370136Z","title":null,"venue":null,"work_id":"5e70cc15-4edb-401e-8064-cd299fea29e0","year":2019},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.854045Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:04ebfa64dcba58df3a0af9e0e39c8b8ced7d13515a76adfba9d16338ddea1d96","observation_id":"82a4b9e8-a88a-4978-85f7-292e48558915","resolution":{"observed_at":"2026-08-06T20:23:12.432400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.921679Z","title":null,"venue":null,"work_id":"bc5776ef-baf0-4e81-889f-a8f88d763881","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.459568Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:6dd8ed3fef595df3f3b5b82cc339ed5bc79b28d5c078d4e63f61f75402b0817f","observation_id":"81360729-f072-4c54-b3ad-1f54066d5c5c","resolution":{"observed_at":"2026-08-06T20:23:13.045392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T20:23:11.007396Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:11.007396Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:5f80fb161bd515332ef851346c08bf6dcf2a1820a0f44c77043d395192739acd","observation_id":"312b2387-692d-428f-b045-4841fb73ad65","resolution":{"observed_at":"2026-08-06T20:23:11.007396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.203887Z","title":null,"venue":null,"work_id":"8827ab93-3f0a-4e49-9d0e-ea0f8fd5b3dd","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:11.147498Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:0c6305ca225714319995bf696ac763c4f9211bfaf416ddc070572d2ca9f20ef5","observation_id":"7cbd7307-683a-477e-b16c-06b410c55bbe","resolution":{"observed_at":"2026-08-06T20:23:12.292772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:12.004496Z","title":null,"venue":null,"work_id":"42fbba58-4fba-42ef-b095-8f56802d09fc","year":2023},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:11.236416Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:351983f9a366f38c115cffaefdf661a0c304e4752212aa2c4c01a2a910a3b92f","observation_id":"2ca5ed73-8e11-4321-8050-b223b8889972","resolution":{"observed_at":"2026-08-06T20:23:12.068144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05897","last_updated":"2025-04-08T10:47:37Z","snapshot_observed_at":"2026-08-16T12:43:03.903686Z","submitted_at":"2025-04-08T10:47:37Z","title":"HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05897","snapshot_observed_at":"2026-08-06T20:23:11.321915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:11.321915Z"},"links":{"cited_paper":"/paper/2504.05897","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:3356ce447fab03609fd49c093923f0c2256b4601974f882d892cb9844462f662","observation_id":"8aa3366e-4b03-4a9e-97e7-c694e98953dd","resolution":{"observed_at":"2026-08-06T20:23:11.321915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:10.932828Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:10.932828Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:4835bd6b74ffc8df5ce060dcd6d89896cb672a9108998fde827c689986721100","observation_id":"72cd1495-ea5b-4234-864d-b2433786a270","resolution":{"observed_at":"2026-08-06T20:23:10.932828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:11.849355Z","title":"2024.{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"54716f5d-8ddd-4df2-a6b4-32b7a353c6fe","year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:11.429005Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:f0a9a3d8e7f55164600a6a905512bc952bc53199c49ad08f0693f01be0b33d45","observation_id":"4d750438-4284-444a-9063-5f37783b2aa0","resolution":{"observed_at":"2026-08-06T20:23:11.898805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-06T20:23:08.819309Z","title":"arXiv preprint arXiv:1609.07843 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.819309Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:4f807a9187fe43342b4b90a3248fd4748c2b0fe8046b7c0bb2f1796e5ce9b748","observation_id":"845365b8-9b6d-474c-b622-dd86c4a0ac78","resolution":{"observed_at":"2026-08-06T20:23:08.819309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:07.433412Z","title":"Advances in Neural Information Processing Systems 35 (2022), 16344–16359","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.433412Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:80253a106b6e021a901756d97d7acf116c163bb413c6a4cf7e4535b835154980","observation_id":"1ad134e0-f174-484e-9c75-853194db01f2","resolution":{"observed_at":"2026-08-06T20:23:07.433412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:07.959084Z","title":"In Proceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.959084Z"},"links":{"citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:b8f67d7ee191ef0ace02761f628dd3beee63249c8d1b65184782cc0aafd522e3","observation_id":"2a831765-b1c5-4afe-8fc2-00a250eba7be","resolution":{"observed_at":"2026-08-06T20:23:07.959084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16937","last_updated":"2024-11-18T12:36:13Z","snapshot_observed_at":"2026-08-18T15:45:52.799518Z","submitted_at":"2024-06-17T09:39:34Z","title":"A Complete Survey on LLM-based AI Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16937","snapshot_observed_at":"2026-08-06T20:23:07.166141Z","title":"arXiv preprint arXiv:2406.16937 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.166141Z"},"links":{"cited_paper":"/paper/2406.16937","citing_paper":"/paper/2507.03153"},"observation_digest":"sha256:ca174e9f5d6c2f1c00c2bcd578bdd0913463b83cfae4861ad9b0dea4341da427","observation_id":"30a9b1a4-667b-4e1b-be27-98305084f558","resolution":{"observed_at":"2026-08-06T20:23:07.166141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03153","last_updated":"2025-07-03T20:20:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T03:16:43.092187Z","submitted_at":"2025-07-03T20:20:33Z","title":"HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2507.03153."}