{"as_of":"2026-08-09T19:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b58cce16e0be612c5aa3346dbcd19fa40e1f1bf8601da59f9c8f4b60c8575b08","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:23:40.464868Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":35,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:e0f4e1b80f4ec3cdd863707949548e1f67d4c02dc618c7adbbafdb11638b8865","observation_id":"2bc4fb11-e460-4e97-b424-997ebd15a324","resolution":{"observed_at":"2026-05-19T20:28:39.595886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-12T20:22:10.482509Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2308.14508"},"observation_digest":"sha256:dbbc99c94ed5aa1cc9e2877837a05648253d0dc8bd03eaafa993ddc0ad6af9e5","observation_id":"893042cb-2f4c-4cb9-b6da-5060bc06b822","resolution":{"observed_at":"2026-05-12T20:22:10.655008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T11:53:06.570968Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2312.00752"},"observation_digest":"sha256:5387c7053e33b35392d4dfa8ccfba717c52b6a5192518095bd30f61a819c4dc6","observation_id":"439813f7-7dac-45fa-b2da-58d1b293abb9","resolution":{"observed_at":"2026-05-10T11:53:06.693605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T21:37:00.014069Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2401.09417"},"observation_digest":"sha256:44a68cf67b9cf5920e62797dfd7cf9795510c161c4cca7a315b4c59a8563cf66","observation_id":"498838b4-9f57-4190-b0bd-c8cddfe07ccf","resolution":{"observed_at":"2026-05-11T21:37:00.185361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T03:55:20.355345Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2404.06654"},"observation_digest":"sha256:46a4397377c8748818ace6638d3b024c47dbbebfb87b8abeea1963209e03aefd","observation_id":"4272cbb2-d1e6-4182-9ba8-2c942d28a784","resolution":{"observed_at":"2026-05-11T03:55:20.565845Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T18:17:00.157129Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2404.07143"},"observation_digest":"sha256:7014880cca1409ce9cc92f208b37ae53b21dd43f390113d2bc1fb9f2497f6f9b","observation_id":"5f63efcc-4fa5-4b5e-9350-5afc7e81c6a9","resolution":{"observed_at":"2026-05-21T18:17:00.225304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2410.04960","last_updated":"2026-06-04T11:59:03Z","snapshot_observed_at":"2026-08-02T12:51:51.839797Z","submitted_at":"2024-10-07T11:59:54Z","title":"On Efficient Variants of Segment Anything Model: A Survey","version":5},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-05-23T19:42:24.122342Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2410.04960"},"observation_digest":"sha256:763f836df082e6615e1d5035e95d505eac65fbfc60eab59bf9e59a75383adc5e","observation_id":"503200b2-bae9-4401-a55f-8ff10a26a1de","resolution":{"observed_at":"2026-05-23T19:43:23.468594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-09T12:23:40.464868Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-09T12:12:17.422915Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.464868Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:be500256276fd1a37c4f1a7823db9e55684b58d508d3d25395bbdf803caa7920","observation_id":"aedfadff-b42b-4e90-9a3d-fa558079e64d","resolution":{"observed_at":"2026-08-09T12:23:40.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:8772a4b4c81f475dd73770b19099067711b1559d454d0c1090dedcc3f57a36dd","observation_id":"514cd672-df6f-4d31-93dc-794f790a38cc","resolution":{"observed_at":"2026-05-16T06:15:46.217139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-07T14:08:07.209849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19959","last_updated":"2025-07-30T16:46:12Z","snapshot_observed_at":"2026-08-09T01:20:29.114355Z","submitted_at":"2025-05-26T13:21:18Z","title":"MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.209849Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2505.19959"},"observation_digest":"sha256:299ff3c17dbf4edb7f1c4eb24ba6c6d5e650fec5231a3d5fbf02275adab86a53","observation_id":"969928fe-81f9-49eb-b8bc-0c3df11bde47","resolution":{"observed_at":"2026-08-07T14:08:07.209849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2506.06313","last_updated":"2026-05-07T11:22:14Z","snapshot_observed_at":"2026-07-31T17:28:25.545872Z","submitted_at":"2025-05-26T14:45:12Z","title":"Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T14:10:29.387828Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2506.06313"},"observation_digest":"sha256:3573e113e18f2bafcec8aecf0cec6d5ddf6e98b6e31737efab1e5daae538eb1a","observation_id":"6a4a2321-d8b3-4ac7-848e-669d909d4ada","resolution":{"observed_at":"2026-05-19T14:12:23.265868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-07T05:01:39.109017Z","title":"LongNet : Scaling Transformers to 1,000,000,000 Tokens , July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09022","last_updated":"2025-06-11T11:53:38Z","snapshot_observed_at":"2026-08-09T03:39:46.389304Z","submitted_at":"2025-06-10T17:50:04Z","title":"Do Multiple Instance Learning Models Transfer?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:01:39.109017Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2506.09022"},"observation_digest":"sha256:1b92d2fe263651c60eda4c8e05556d592d5447349ed86de0f985e6ae0e8b227d","observation_id":"fd9b1556-fe8c-4c7b-8ee5-1cf65ebd0786","resolution":{"observed_at":"2026-08-07T05:01:39.109017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2506.15155","last_updated":"2026-05-06T17:46:08Z","snapshot_observed_at":"2026-07-06T21:44:04.066471Z","submitted_at":"2025-06-18T05:56:01Z","title":"eLLM: Elastic Memory Management Framework for Efficient LLM Serving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T09:41:45.544399Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2506.15155"},"observation_digest":"sha256:f47e83eca8b117d33703c7349f914dc24c02122db123e224a1af73d803138cda","observation_id":"01f2c97b-f5b0-4c38-aaac-ce18708df54b","resolution":{"observed_at":"2026-05-19T09:42:13.860674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-06T19:26:55.444773Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05633","last_updated":"2025-07-08T03:29:09Z","snapshot_observed_at":"2026-08-06T23:51:01.012654Z","submitted_at":"2025-07-08T03:29:09Z","title":"SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:26:55.444773Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2507.05633"},"observation_digest":"sha256:491690dfd6d0c60b24be7970d45c37523dad47339efa2e5a932cffaf80f4907e","observation_id":"29ee0081-013f-4c42-9c2b-5598e1c035e6","resolution":{"observed_at":"2026-08-06T19:26:55.444773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-06T15:57:00.050068Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-09T00:51:52.133273Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:00.050068Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:108c6b1a17f08c40ca946302ed601c994ff29ffefba4e7a8e4d68d268f59e723","observation_id":"21e853b6-1b59-4817-a64f-a06b7d6d9c4c","resolution":{"observed_at":"2026-08-06T15:57:00.050068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:58fa0b1fc0681e1a189f40ab7275e80f1635ce9188273af21868ad7e193eae58","observation_id":"bc1e33a6-66c6-4201-be3f-bbe78c148eb5","resolution":{"observed_at":"2026-05-19T03:06:59.963072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T10:36:59.826359Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03973","last_updated":"2025-09-04T07:58:52Z","snapshot_observed_at":"2026-08-09T07:46:17.545398Z","submitted_at":"2025-09-04T07:58:52Z","title":"SAC-MIL: Spatial-Aware Correlated Multiple Instance Learning for Histopathology Whole Slide Image Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:59.826359Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2509.03973"},"observation_digest":"sha256:9ca35a449aa962ae16e76bfda905a4dfe86552a288b255d0aca68c06e124a6be","observation_id":"62ce59f6-f3bb-4ffe-8573-e2249103063a","resolution":{"observed_at":"2026-08-05T10:36:59.826359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2509.12635","last_updated":"2026-05-10T22:28:15Z","snapshot_observed_at":"2026-08-03T03:02:00.357806Z","submitted_at":"2025-09-16T03:53:32Z","title":"Positional Encoding via Token-Aware Phase Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T16:19:48.318702Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2509.12635"},"observation_digest":"sha256:7660f8291f3e688526084a0381bc94316fd5600b4d202c339e4a0e602fdfdd44","observation_id":"11962a2c-885d-4971-8409-7a37875131b4","resolution":{"observed_at":"2026-05-18T16:21:36.698535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:d1984b9c4507f0d9f05ad614ab6de926a9dc68f53d1a753e677da1659e0df2cb","observation_id":"c40f6a54-1ad0-431c-b955-beb850f50ded","resolution":{"observed_at":"2026-05-13T23:49:11.019394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2512.12602","last_updated":"2026-05-08T15:47:57Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T08:51:02Z","title":"Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T23:06:27.535997Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2512.12602"},"observation_digest":"sha256:3d4a3b7714b7f432544531828f3323a31d38c22c9011f65bd4f6491dcddec780","observation_id":"cc2dba98-2e0b-44c1-ae9b-f40e1ce9bc8b","resolution":{"observed_at":"2026-05-16T23:08:39.723808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2512.13368","last_updated":"2026-05-22T09:00:57Z","snapshot_observed_at":"2026-08-02T00:54:15.217111Z","submitted_at":"2025-12-15T14:23:57Z","title":"BlossomRec: Block-level Fused Sparse Attention Mechanism for Sequential Recommendations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T07:20:46.517218Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2512.13368"},"observation_digest":"sha256:5cc24a4a80ef9dedbbb4d791f3bf63a182eec6ded287a9b39679abcdbcf14a64","observation_id":"e00b95e4-cc3d-461e-88d3-d30dd376ddf5","resolution":{"observed_at":"2026-05-25T07:26:42.097242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:75cfad87ba6c7c19b9a923732a957d700e7cb06009c03b0517cbde75effdd9f0","observation_id":"a9fe698e-6540-4fbb-aabc-5f78567ae3f8","resolution":{"observed_at":"2026-05-15T21:00:17.880244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:7ad9bd40d69226309490b56198627bc2b79dbc390ad54eb5b3c8e900a9e6d157","observation_id":"53f0d9ae-af95-48f1-8b48-2e544644f1c0","resolution":{"observed_at":"2026-05-21T12:50:09.496438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-02T22:05:42.990630Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens.arXiv preprint arXiv:2307.02486,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:42.990630Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:4189bc18c32d7a8e75d30022b5d623c2eb636efaf5a3db6c3b8a6c9298967246","observation_id":"aa603f81-c326-43d3-a171-8025dcaac809","resolution":{"observed_at":"2026-08-02T22:05:42.990630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2603.04759","last_updated":"2026-04-09T15:16:58Z","snapshot_observed_at":"2026-08-02T20:00:30.056450Z","submitted_at":"2026-03-05T03:16:16Z","title":"Stacked from One: Multi-Scale Self-Injection for Context Window Extension","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T16:57:09.401220Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2603.04759"},"observation_digest":"sha256:f3a0cfd300deed06848a3a84bc5662a87f0b49952650d5eba43e073e4db7b422","observation_id":"e3945629-6ca0-44ff-8f44-2bdf5d59f2b9","resolution":{"observed_at":"2026-05-15T17:00:10.317900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-02T17:49:26.189385Z","title":"9 HiCI: Hierarchical Construction–Integration for Long-Context Attention Dehaene, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.20843","last_updated":"2026-07-20T06:52:15Z","snapshot_observed_at":"2026-08-06T20:35:35.821367Z","submitted_at":"2026-03-21T14:59:45Z","title":"HiCI: Hierarchical Construction-Integration for Long-Context Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T17:49:26.189385Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2603.20843"},"observation_digest":"sha256:d50760d5964c81620590608559f6a14b9de290761c984789691588ab304a8e7b","observation_id":"7b214591-f01d-4692-a69a-396c175fc8a8","resolution":{"observed_at":"2026-08-02T17:49:26.189385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-07-13T17:15:51.142086Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.27048","last_updated":"2026-06-22T15:38:22Z","snapshot_observed_at":"2026-07-13T17:15:48.953605Z","submitted_at":"2026-03-27T23:33:33Z","title":"MOOZY: A Patient-First Foundation Model for Computational Pathology","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T17:15:51.142086Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2603.27048"},"observation_digest":"sha256:1d6d888ac638065c77ecbf2b972bafa2470d23705bccb51f00cfd51e0887c8f3","observation_id":"fd242692-f0fd-4259-9bd9-d8fa5708c4ae","resolution":{"observed_at":"2026-07-13T17:15:51.142086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2604.18580","last_updated":"2026-04-21T16:04:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T17:59:08Z","title":"Sessa: Selective State Space Attention","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T04:45:43.948266Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2604.18580"},"observation_digest":"sha256:84fd66e28a517c9f627c459e41fa7b20e6812155d7b35a5c87a4283c70b43799","observation_id":"4ff236fb-b17a-435e-b5bb-80d9512648e1","resolution":{"observed_at":"2026-05-10T04:50:23.007276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2604.20819","last_updated":"2026-04-22T17:46:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T17:46:09Z","title":"Stream-CQSA: Avoiding Out-of-Memory in Attention Computation via Flexible Workload Scheduling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:16:35.310423Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2604.20819"},"observation_digest":"sha256:13cf406d545aff971fa73471378ada5ba24aefb7ea226600d36635ffb695807f","observation_id":"c39d36f0-df7f-4c30-bb5b-fe5630859138","resolution":{"observed_at":"2026-05-10T00:19:47.000602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:52:45.320454Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2605.10544"},"observation_digest":"sha256:bc16f4922ab6462eb27d1dc0dcd59951a8d539682c77cf81486da687637b5b7d","observation_id":"ef438577-df1a-4a28-b339-8701864aed92","resolution":{"observed_at":"2026-05-12T06:51:29.185396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2605.30716","last_updated":"2026-05-29T01:15:13Z","snapshot_observed_at":"2026-08-03T09:50:36.355081Z","submitted_at":"2026-05-29T01:15:13Z","title":"Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:15:21.270610Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2605.30716"},"observation_digest":"sha256:53594d3081ec398d5b5e19b314893619418faa31d74c7db036269f0dd5c1ae9e","observation_id":"6ec20bb0-3525-4820-9fa8-be6109046846","resolution":{"observed_at":"2026-06-29T00:12:50.365339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2606.02680","last_updated":"2026-06-01T15:56:31Z","snapshot_observed_at":"2026-07-06T23:43:02.654629Z","submitted_at":"2026-06-01T15:56:31Z","title":"Locality Does Not Imply Reachability: Boundary Repair in Block-Sparse Causal Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:34:46.265644Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2606.02680"},"observation_digest":"sha256:02c57833e7f105a98594905c13f5872d2993bae24565bfc54f29f7d94cb082b9","observation_id":"b14958e4-e93c-4155-b0da-aee73acbee6c","resolution":{"observed_at":"2026-07-01T22:16:16.389951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-08-08T14:28:58.546665Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:19019cc23cb41fe39b4f1b462c7d24ecf1317806f7a29f0c21a3967f2f7f6cb0","observation_id":"9e0aa39d-5841-4358-9f00-eee15d1b7795","resolution":{"observed_at":"2026-07-02T13:36:59.482545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2606.24331","last_updated":"2026-06-23T09:09:55Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:09:55Z","title":"Transformer-Based Language Models Across Domain Verticals: Architectures, Applications and Critical Assessment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T00:07:22.311907Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2606.24331"},"observation_digest":"sha256:34c8fad09f12e0c73f29e7bc0a861ddd735b2efee1a1d1e5d6c5ff9e366de7b7","observation_id":"82b59a12-7f0c-4ef0-b214-49e2933d103d","resolution":{"observed_at":"2026-07-04T16:59:57.645025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2606.28560","last_updated":"2026-06-26T19:28:48Z","snapshot_observed_at":"2026-08-03T02:12:51.554839Z","submitted_at":"2026-06-26T19:28:48Z","title":"Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T01:12:34.409341Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2606.28560"},"observation_digest":"sha256:64a04c062754934968306e1736bf6ab499337017ffa367af689f1388518a34dd","observation_id":"afde34f0-80a1-437d-8851-a659153134c5","resolution":{"observed_at":"2026-07-01T15:45:48.017063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2606.29844","last_updated":"2026-06-29T06:33:37Z","snapshot_observed_at":"2026-08-03T00:15:01.794218Z","submitted_at":"2026-06-29T06:33:37Z","title":"MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-30T06:11:23.742632Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2606.29844"},"observation_digest":"sha256:1cc0d10293c73af0cde1383d32e93b25a473969ce00ff1db3c80c60562418872","observation_id":"b5dc1aca-f97f-4b6b-b56e-f1f328b8022f","resolution":{"observed_at":"2026-06-30T06:14:17.915989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:00e3365022d9db4fc70fedb1d8e5f768fcc85217a621f2fd760b314af6ffa7a2","observation_id":"573f8ee7-c0a4-4b9b-97df-9027a41a8792","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-02T01:25:51.548781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14711","last_updated":"2026-07-17T20:57:29Z","snapshot_observed_at":"2026-08-08T22:22:41.517289Z","submitted_at":"2026-07-16T08:22:08Z","title":"VideoSEMA: a scalable and efficient Mamba-like attention for video understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:51.548781Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2607.14711"},"observation_digest":"sha256:efadfc58447e7379416b48a1c219575a2576a9aa5d852c21c531638ee2dbfa6e","observation_id":"5d0c9fef-a38b-4d75-a49b-428c6384792b","resolution":{"observed_at":"2026-08-02T01:25:51.548781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-01T15:40:54.950485Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens.arXiv preprint arXiv:2307.02486, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18218","last_updated":"2026-07-22T19:34:58Z","snapshot_observed_at":"2026-08-05T20:59:45.167071Z","submitted_at":"2026-07-20T17:52:33Z","title":"GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:40:54.950485Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2607.18218"},"observation_digest":"sha256:2dbb22004675f953f0893887bd79bb87cef7e866af57b6dc458f605a9d78ce11","observation_id":"cb0f6fc6-4060-45de-91d0-d89473ac5e10","resolution":{"observed_at":"2026-08-01T15:40:54.950485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-01T12:16:54.898499Z","title":"arXiv e-prints , keywords =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19640","last_updated":"2026-07-22T00:21:36Z","snapshot_observed_at":"2026-08-04T21:04:08.236868Z","submitted_at":"2026-07-22T00:21:36Z","title":"AGNFormer I: Reconstruction of AGN spectra using a probabilistic transformer model","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-08-01T12:16:54.898499Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2607.19640"},"observation_digest":"sha256:eca1a9e4a2679305d111c9b16c6bb6d7e2d346256ca8d44926a854abe34a91cc","observation_id":"9be11add-c3cf-46e4-82df-950bbe421d36","resolution":{"observed_at":"2026-08-01T12:16:54.898499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-01T06:59:50.579006Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21731","last_updated":"2026-07-23T18:28:13Z","snapshot_observed_at":"2026-08-08T06:17:55.798938Z","submitted_at":"2026-07-23T18:28:13Z","title":"RED-PIM: Reducing Data Movement for Transformers using Processing-in-Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T06:59:50.579006Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2607.21731"},"observation_digest":"sha256:55a1ceb0bd051c7f7f29b814586a3f50c679a7955b73f8cfef274effdf9b5200","observation_id":"efd9c8a1-20f5-47a5-8dde-5eea234660fe","resolution":{"observed_at":"2026-08-01T06:59:50.579006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.02486/citation-record","integrity":"/paper/2307.02486/integrity","json":"/paper/2307.02486/citation-record.json","paper":"/paper/2307.02486"},"outbound":[],"paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2307.02486."}