{"as_of":"2026-08-18T14:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb89600d8ddc1af67dcdc5bb9ebe89197dec894e027943edd322301c65f3754","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":53,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:30:12.274120Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:6c46c6d2083ca995a6e747faa739521d136dad1a7d54cbb8c01e3f56803fda61","observation_id":"de159343-96e4-44b2-b362-1894086c305c","resolution":{"observed_at":"2026-05-13T05:47:27.926738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-05-15T11:44:38.066501Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2403.17297"},"observation_digest":"sha256:2fcc1d82fd791eca78d72f132ce48b9359f033da4070f5f020719c61554ed206","observation_id":"b751f984-93be-4913-a9ad-b0e1f11f1341","resolution":{"observed_at":"2026-05-15T11:44:38.193152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2403.20208","last_updated":"2026-04-22T07:34:25Z","snapshot_observed_at":"2026-07-06T17:53:06.519891Z","submitted_at":"2024-03-29T14:41:21Z","title":"Unlock the Potential of Large Language Models for Predictive Tabular Tasks in Data Science with Table-Specific Pretraining","version":8},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T02:44:01.340415Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2403.20208"},"observation_digest":"sha256:03328e1bf121948ca576d7436706efb2a324c4368a35aa0b5530081b9f5450af","observation_id":"070d67f6-37b9-4881-89a9-033a825c40db","resolution":{"observed_at":"2026-05-24T02:45:56.148382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T18:00:53.389420Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2404.06395"},"observation_digest":"sha256:ee05fe76e4b6a62f5a8fc7688be17aad0339545ca82ced060d7b964dddb87067","observation_id":"b7e885b4-9ee4-48ac-9fc8-46f35fdd1af0","resolution":{"observed_at":"2026-05-13T18:00:53.587242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-17T19:41:15.885170Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T18:17:00.157129Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2404.07143"},"observation_digest":"sha256:32e576077ba56386d5866c059a156138db6d822ef5ba2b25c2e7310f5aac1464","observation_id":"2e04b2ef-fc49-44a2-80dd-3f3838c390c4","resolution":{"observed_at":"2026-05-21T18:17:00.182745Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T10:31:03.777169Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2406.07887"},"observation_digest":"sha256:011935ab896b4be6f05942efde567e5062ad2e491905b5d8cd979e76b4c5561a","observation_id":"b8fb69a8-2b39-455d-b764-0f6d566955ae","resolution":{"observed_at":"2026-05-18T10:31:03.937188Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:1acfd109b83038fadb53e9affa29c6bb4bca3668afa4bbe9f13efa239d0d3edc","observation_id":"a1f18415-5f96-4a5d-b965-1694933d7121","resolution":{"observed_at":"2026-05-17T22:58:17.328146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T08:08:09.444352Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2406.12793"},"observation_digest":"sha256:26365cca5d823c29ef854341ee305ae1ab29d4baae89de28e74e24856432fe77","observation_id":"1efb07d9-cfa6-45f8-8402-3048e9315387","resolution":{"observed_at":"2026-05-11T08:08:09.592936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:8aaabc48ecb2522e0cddf8fed37293d8ebb31dd2cdd55112637647d844035bd0","observation_id":"ceaa4416-f71c-4ce5-b43a-767c2f1d8ec2","resolution":{"observed_at":"2026-05-10T18:26:22.274236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-12T20:02:51.236503Z","title":"Effective long-context scaling of foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10083","last_updated":"2024-12-04T11:49:04Z","snapshot_observed_at":"2026-08-17T19:22:02.625747Z","submitted_at":"2024-11-15T10:01:52Z","title":"Xmodel-1.5: An 1B-scale Multilingual LLM","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T20:02:51.236503Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2411.10083"},"observation_digest":"sha256:2b47155d306782727936601aa874ea5ee9d748eb48f3197ba8f1cc87d0244c98","observation_id":"6f329ffc-b83a-4509-a065-6b54d8144d4f","resolution":{"observed_at":"2026-08-12T20:02:51.236503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-12T10:17:30.330911Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19360","last_updated":"2024-11-28T20:14:47Z","snapshot_observed_at":"2026-08-17T10:02:07.651657Z","submitted_at":"2024-11-28T20:14:47Z","title":"DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T10:17:30.330911Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2411.19360"},"observation_digest":"sha256:dfba7f50b236b469daa2db8546d2459515f4661aa4cf50f04b8acf4eaba8d7b2","observation_id":"6fd3afee-f37b-472f-bf7b-881a4892d6bb","resolution":{"observed_at":"2026-08-12T10:17:30.330911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-12T04:34:12.107913Z","title":"Wenhan Xiong, Jingyu Liu, Igor Molybog, Hejia Zhang, Prajjwal Bhargava, Rui Hou, Louis Martin, Rashi Rungta, Karthik Abinav Sankararaman, Barlas Oguz, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01253","last_updated":"2025-01-22T15:09:58Z","snapshot_observed_at":"2026-08-16T16:50:21.438663Z","submitted_at":"2024-12-02T08:22:56Z","title":"Yi-Lightning Technical Report","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:34:12.107913Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2412.01253"},"observation_digest":"sha256:0e774e44baceefa41389b0333f73397470d3b855c34d2c0da9f931c5ade36f03","observation_id":"dbb1d31c-dfe5-4825-9108-012abf3a98a3","resolution":{"observed_at":"2026-08-12T04:34:12.107913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-11T19:11:06.340763Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07171","last_updated":"2024-12-10T04:09:29Z","snapshot_observed_at":"2026-08-14T07:22:41.809657Z","submitted_at":"2024-12-10T04:09:29Z","title":"Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T19:11:06.340763Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2412.07171"},"observation_digest":"sha256:15b64a2962915a6e5f57c80c0ed2578b062c56b368974e1e730725098e108f6c","observation_id":"53c051cd-2d4c-4f9c-a8b2-32f3f627ae41","resolution":{"observed_at":"2026-08-11T19:11:06.340763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:1e128e7a62eeb4e1d4b3651edb4e468f6ffef5eb17de29ad2614a7fd6f3f11a4","observation_id":"24f88f60-4a42-4d81-8380-fccf16f39c25","resolution":{"observed_at":"2026-05-23T06:25:27.807139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-10T21:01:58.744944Z","title":"Effective Long-Context Scaling of Foundation Mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06625","last_updated":"2025-01-11T19:21:53Z","snapshot_observed_at":"2026-08-15T11:11:55.610347Z","submitted_at":"2025-01-11T19:21:53Z","title":"Guided Code Generation with LLMs: A Multi-Agent Framework for Complex Code Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:01:58.744944Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.06625"},"observation_digest":"sha256:6e3439d67fc1650912aa575781fe4e6a8343527559874844eb496ab06e344ee1","observation_id":"02fb6abf-b3da-4d9a-8409-20c689e484c8","resolution":{"observed_at":"2026-08-10T21:01:58.744944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-10T20:26:11.222878Z","title":"Effective long-context scaling of foundation mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09767","last_updated":"2025-01-15T05:17:12Z","snapshot_observed_at":"2026-08-16T01:50:09.153081Z","submitted_at":"2025-01-15T05:17:12Z","title":"LeMo: Enabling LEss Token Involvement for MOre Context Fine-tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:26:11.222878Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.09767"},"observation_digest":"sha256:1403507286ae6c852d12b99450b35e06a71ed8a71e804e206252ac252751d4f9","observation_id":"10708ca0-81be-4672-8a61-9026eb398019","resolution":{"observed_at":"2026-08-10T20:26:11.222878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-10T19:04:35.019555Z","title":"Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng, Radha Poovendran, Yejin Choi, and Bill Yuchen Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10648","last_updated":"2025-01-18T03:48:56Z","snapshot_observed_at":"2026-08-15T05:30:47.115727Z","submitted_at":"2025-01-18T03:48:56Z","title":"DNA 1.0 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:04:35.019555Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.10648"},"observation_digest":"sha256:71c4b7bd5dc3128e0506821af1aa62246dd131cbaba5413090913265a4804cb2","observation_id":"617a8f47-0fa7-4ea3-8810-8c927afbb859","resolution":{"observed_at":"2026-08-10T19:04:35.019555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-10T16:52:49.887793Z","title":"A., Oguz, B., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12766","last_updated":"2025-05-26T04:01:12Z","snapshot_observed_at":"2026-08-18T13:42:25.190955Z","submitted_at":"2025-01-22T10:01:54Z","title":"NExtLong: Toward Effective Long-Context Training without Long Documents","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-10T16:52:49.887793Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.12766"},"observation_digest":"sha256:df7b292158a4fce4f8cdb7502d0e29f1ccde312fd78f753d4aef39383683b971","observation_id":"8f7c402a-5d74-43cc-ade3-a85a54bc7d24","resolution":{"observed_at":"2026-08-10T16:52:49.887793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T05:25:59.964619Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2501.15383"},"observation_digest":"sha256:651989640171291550fccc372444807f2263d460bbbac222ac9009751bbfc717","observation_id":"95c1ff53-a00f-4553-93c3-e7972323f675","resolution":{"observed_at":"2026-05-15T05:26:00.157889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T11:50:03.340792Z","title":"Effective long-context scaling of foundation models.arXiv preprint arXiv:2309.16039, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-13T22:41:46.187040Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.340792Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:10bb4c82843a7f909fa4f28085e614f4c7ad159f418b2cf8c943e69b2f5893b6","observation_id":"deef4fd9-70e1-4e17-9a3e-b4ff77da508b","resolution":{"observed_at":"2026-08-09T11:50:03.340792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T11:11:17.807536Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-17T01:39:21.989668Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.807536Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:62adad9a81b7ae4a2a32fd677bf348a9859e94dbe569c5e246a9911b7d2a917c","observation_id":"f80f3215-5206-4997-ac88-d9ea0cd44b21","resolution":{"observed_at":"2026-08-09T11:11:17.807536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T05:48:07.677274Z","title":"A., Oguz, B., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03147","last_updated":"2025-02-05T13:16:41Z","snapshot_observed_at":"2026-08-17T08:23:37.706260Z","submitted_at":"2025-02-05T13:16:41Z","title":"Scalable In-Context Learning on Tabular Data via Retrieval-Augmented Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T05:48:07.677274Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.03147"},"observation_digest":"sha256:463ed53d1af1f4e5c9587e5224e94a0968cfd9d71bcb1ab1d98dc07b26c518b3","observation_id":"c75a5024-6706-41a3-a1ff-a6369bb8ca60","resolution":{"observed_at":"2026-08-09T05:48:07.677274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T05:02:35.824173Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03358","last_updated":"2025-06-09T14:31:04Z","snapshot_observed_at":"2026-08-16T13:38:20.945007Z","submitted_at":"2025-02-05T16:53:45Z","title":"Minerva: A Programmable Memory Test Benchmark for Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T05:02:35.824173Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.03358"},"observation_digest":"sha256:ae6c5722f7e0084e81f85cda1a63346e005c8e1be511c540cc15c9b4072cf54a","observation_id":"39c83ac0-c8f2-4c4c-b025-86d7bc3dfe3d","resolution":{"observed_at":"2026-08-09T05:02:35.824173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-08T11:20:23.698827Z","title":"org/abs/2309.16039","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-14T18:27:41.930983Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.698827Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:8cc1ade40371a13994a966257b17446bec093dfdc3b3824603dc807e2c94dba1","observation_id":"87cf181b-9fce-4008-b8a2-ed9fabef6bc7","resolution":{"observed_at":"2026-08-08T11:20:23.698827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:377cdf3c66a1f40b17ac16f06d36850ec5141a7d48b5bc00408c260e47a57456","observation_id":"3de63877-21a0-4fe7-b85d-29e2c110e9a0","resolution":{"observed_at":"2026-05-16T06:15:46.122456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T12:30:12.274120Z","title":"Effective long-context scaling of foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12637","last_updated":"2025-04-17T04:46:57Z","snapshot_observed_at":"2026-08-17T19:42:04.585279Z","submitted_at":"2025-04-17T04:46:57Z","title":"Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:30:12.274120Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.12637"},"observation_digest":"sha256:0c53d15c4080141ef778b68dc6d85f147df69d7229977df33230dfa1cf1b1ea5","observation_id":"7317f681-6c9b-44a3-bc55-2703162eaa23","resolution":{"observed_at":"2026-08-16T12:30:12.274120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T11:32:06.117439Z","title":"Xiong, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:06.117439Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:bd58e7632d4666c8d51954eaa6908f0c08dcda86c010dc80e51ae9b660a89a0f","observation_id":"cdea5cac-3103-42ef-b352-3f11788b9353","resolution":{"observed_at":"2026-08-16T11:32:06.117439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T11:28:01.947054Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15527","last_updated":"2025-04-22T02:08:45Z","snapshot_observed_at":"2026-08-17T14:41:49.816681Z","submitted_at":"2025-04-22T02:08:45Z","title":"Compass-V2 Technical Report","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T11:28:01.947054Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.15527"},"observation_digest":"sha256:368a4eb28533a4456ab52fd8230ff5232153b721511a35b154ba01c69f5835e3","observation_id":"e07c4a97-c7c8-452f-96ee-184321141d9c","resolution":{"observed_at":"2026-08-16T11:28:01.947054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-16T10:12:42.526808Z","title":"Effective long-context scaling of foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18857","last_updated":"2025-04-26T08:46:10Z","snapshot_observed_at":"2026-08-17T00:01:03.539955Z","submitted_at":"2025-04-26T08:46:10Z","title":"Effective Length Extrapolation via Dimension-Wise Positional Embeddings Manipulation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T10:12:42.526808Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2504.18857"},"observation_digest":"sha256:6fda5adac95b60b7224cfc6de51fbbea74d63e5912b7f40b3695e1ea444284b5","observation_id":"8184d268-409a-4886-a8b4-19829f700d2e","resolution":{"observed_at":"2026-08-16T10:12:42.526808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T06:35:27.813995Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.09388"},"observation_digest":"sha256:ddfe5819be759211ff8594c75ec5259de50797c21507ec3eb92000be5dab2fdc","observation_id":"a8d8f529-d730-47bb-b74f-28e120acbda6","resolution":{"observed_at":"2026-05-09T06:35:28.628333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T15:08:03.619535Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17134","last_updated":"2025-06-03T03:04:17Z","snapshot_observed_at":"2026-08-16T09:14:09.601864Z","submitted_at":"2025-05-22T04:05:02Z","title":"LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:03.619535Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.17134"},"observation_digest":"sha256:780c35e64ac2c1b67c3643b135879865b01d6ae8483fd8ddad65f20a6cc31098","observation_id":"ac372b97-7aa7-4b73-a546-883bb3bd8fc3","resolution":{"observed_at":"2026-08-07T15:08:03.619535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T14:52:14.996527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17296","last_updated":"2025-05-22T21:23:20Z","snapshot_observed_at":"2026-08-16T02:18:52.806751Z","submitted_at":"2025-05-22T21:23:20Z","title":"SELF: Self-Extend the Context Length With Logistic Growth Function","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:52:14.996527Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.17296"},"observation_digest":"sha256:09272a64378b9f60425b599a4a900d21d2951813bb83a87e8b7924f36805c72a","observation_id":"498644d0-ddce-4eef-a8db-a0c47deab8f7","resolution":{"observed_at":"2026-08-07T14:52:14.996527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T14:52:55.492170Z","title":"Effective long-context scaling of foundation models.arXiv preprint arXiv:2309.16039, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17315","last_updated":"2026-06-02T22:13:24Z","snapshot_observed_at":"2026-08-14T01:40:04.679839Z","submitted_at":"2025-05-22T22:09:47Z","title":"Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:55.492170Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.17315"},"observation_digest":"sha256:dc47725dfaf2a8348e9c7ee57955329c4a0ac815e0d94a55652239763739041d","observation_id":"1b9824f0-230c-4c10-8cb7-1ebe1d5bdeae","resolution":{"observed_at":"2026-08-07T14:52:55.492170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T14:20:26.452682Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-14T04:43:53.465410Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:26.452682Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:fa21add961fdd65a7123a9dfc519aaa35c2855c78ffeedad1a9810195eea06b7","observation_id":"b4197dba-3d4d-4a2f-9023-2461b166a976","resolution":{"observed_at":"2026-08-07T14:20:26.452682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-07T04:54:26.223746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09440","last_updated":"2025-06-11T06:46:49Z","snapshot_observed_at":"2026-08-16T03:27:30.919378Z","submitted_at":"2025-06-11T06:46:49Z","title":"GigaChat Family: Efficient Russian Language Modeling Through Mixture of Experts Architecture","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:54:26.223746Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2506.09440"},"observation_digest":"sha256:7698de59c3e18bd9992d973d07ed39c1d22d2a1c40fccdaa57379133b97f1c1a","observation_id":"5ea00957-85e6-4111-9afa-d33b3265181d","resolution":{"observed_at":"2026-08-07T04:54:26.223746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-06T23:49:48.167491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16024","last_updated":"2025-06-19T04:44:34Z","snapshot_observed_at":"2026-08-16T19:55:45.650072Z","submitted_at":"2025-06-19T04:44:34Z","title":"From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:48.167491Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2506.16024"},"observation_digest":"sha256:6ea202f98545859560fef37258ab53b9550934b2012eaa459d0d96b18aa0b351","observation_id":"1af95218-cebe-4276-b85b-922499cfaf73","resolution":{"observed_at":"2026-08-06T23:49:48.167491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:11263289a7eb4b5788ca1c1767daa9748db1a09dc541c3dbf6ab8bfd50564e9c","observation_id":"f15daf29-d480-49e0-9f74-7e0249d6a1c1","resolution":{"observed_at":"2026-05-15T11:17:24.561802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-06T20:40:09.893452Z","title":"Effective long-context scaling of foundation models.arXiv preprint arXiv:2309.16039, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:09.893452Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:ddb3ac878158b8c7fe47bda82f21d3b6729cd713a045a0ed2a076c31cc8016cc","observation_id":"f97edf73-0655-4743-9206-f8c70b20bf38","resolution":{"observed_at":"2026-08-06T20:40:09.893452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-06T05:13:27.252272Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02122","last_updated":"2025-08-04T07:03:35Z","snapshot_observed_at":"2026-08-14T17:06:16.002227Z","submitted_at":"2025-08-04T07:03:35Z","title":"An Overview of Algorithms for Contactless Cardiac Feature Extraction from Radar Signals: Advances and Challenges","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:13:27.252272Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2508.02122"},"observation_digest":"sha256:d4e2300ccf3502f5fec0f619db24b4a14edc0b70e14795888e9fe5ce171c14b7","observation_id":"0578d433-6bfb-4e80-a395-496323676242","resolution":{"observed_at":"2026-08-06T05:13:27.252272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T17:46:46.815258Z","title":"Effective long-context scaling of foundation models.arXiv preprint arXiv:2309.16039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-18T08:19:19.368048Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:46:46.815258Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2508.15717"},"observation_digest":"sha256:deb11514aabde70a704d8568a18328f4802d06c6c0bdd9734ca7ef05a0ca7fec","observation_id":"400ee6ed-76b1-4e79-a080-bb9d991620fb","resolution":{"observed_at":"2026-08-05T17:46:46.815258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T17:26:28.943342Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16279","last_updated":"2025-08-22T10:35:56Z","snapshot_observed_at":"2026-08-16T14:35:15.039195Z","submitted_at":"2025-08-22T10:35:56Z","title":"AgentScope 1.0: A Developer-Centric Framework for Building Agentic Applications","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T17:26:28.943342Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2508.16279"},"observation_digest":"sha256:b506902a50830cf2fb02d12e3766f7c2d1f9d8bf3437696039e22597185a23bc","observation_id":"bf315b5a-5084-4d13-88b4-86c9807bab4f","resolution":{"observed_at":"2026-08-05T17:26:28.943342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T05:36:56.768551Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05218","last_updated":"2025-09-08T03:13:38Z","snapshot_observed_at":"2026-08-14T23:22:55.529770Z","submitted_at":"2025-09-05T16:20:48Z","title":"HoPE: Hyperbolic Rotary Positional Encoding for Stable Long-Range Dependency Modeling in Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T05:36:56.768551Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2509.05218"},"observation_digest":"sha256:52046203efea7ed4d78fab237ef98e3fbc9e0f4fdaedef0759a26294ccb349de","observation_id":"108ef45b-43d2-4de8-86ff-1f5f4fc182d4","resolution":{"observed_at":"2026-08-05T05:36:56.768551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-04T21:37:23.079381Z","title":"Effective long-context scaling of foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08032","last_updated":"2025-09-09T16:09:19Z","snapshot_observed_at":"2026-08-08T14:11:18.383165Z","submitted_at":"2025-09-09T16:09:19Z","title":"SciGPT: A Large Language Model for Scientific Literature Understanding and Knowledge Discovery","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T21:37:23.079381Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2509.08032"},"observation_digest":"sha256:fa6418f38622a1457940a4b3fced21ebb2695b90bc9585409d9d91ab0b4ede6f","observation_id":"fd421750-e2d4-4161-86ff-1640931f675c","resolution":{"observed_at":"2026-08-04T21:37:23.079381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2509.12635","last_updated":"2026-05-10T22:28:15Z","snapshot_observed_at":"2026-08-14T18:40:13.165342Z","submitted_at":"2025-09-16T03:53:32Z","title":"Positional Encoding via Token-Aware Phase Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T16:19:48.318702Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2509.12635"},"observation_digest":"sha256:f26b68a393faac2bd026cf8f817cd88b2934593d6773e97015bcde24848fe316","observation_id":"68fe0276-efc3-4a0d-8d17-01c722473bd1","resolution":{"observed_at":"2026-05-18T16:21:36.709109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:e4ab5d1487db5aace28053ebefd7c687145689366388ad75fddfb1438501b37d","observation_id":"54d2f944-117c-4f58-9909-61e7e9fba39c","resolution":{"observed_at":"2026-05-13T23:49:10.920344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2512.07805","last_updated":"2026-05-13T18:33:36Z","snapshot_observed_at":"2026-08-12T19:56:56.841927Z","submitted_at":"2025-12-08T18:39:13Z","title":"Group Representational Position Encoding","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T00:04:13.707931Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2512.07805"},"observation_digest":"sha256:072b0bbf08d862261724acf75c828605787517fe165e760164157af997f5d005","observation_id":"4da40a99-a044-43fd-8821-49234d6547b3","resolution":{"observed_at":"2026-05-17T00:08:43.795033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2603.23885","last_updated":"2026-04-18T12:13:54Z","snapshot_observed_at":"2026-08-11T00:45:34.952402Z","submitted_at":"2026-03-25T03:19:09Z","title":"Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T01:15:26.757215Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2603.23885"},"observation_digest":"sha256:abe0ebbcae537e71bbcb07566f551818afcd60a3bc8a8e78839b1674d0a69c89","observation_id":"887d0e6b-6dd6-4ffb-81b2-2f30da466347","resolution":{"observed_at":"2026-05-15T01:18:26.583970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2604.07809","last_updated":"2026-04-09T05:07:57Z","snapshot_observed_at":"2026-08-12T12:35:41.738669Z","submitted_at":"2026-04-09T05:07:57Z","title":"PolicyLong: Towards On-Policy Context Extension","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:28.939977Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2604.07809"},"observation_digest":"sha256:d51e643d2be7d021ec5f45402b2ae3457b6d5a85890a4cb07b8dfffe050417aa","observation_id":"360a7722-9923-41b7-aa4a-43901ae9cbcf","resolution":{"observed_at":"2026-05-11T06:55:59.842670Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-08-17T11:03:28Z","snapshot_observed_at":"2026-08-18T14:18:00.697672Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:b80ace07fbc97c0c0b1c262f4fdbc1bbbf1b0fd76bd08482dcc04e297bacf0e1","observation_id":"3dec61b5-ca15-4c0b-b0e3-e15ef88e1595","resolution":{"observed_at":"2026-05-10T07:16:54.154856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2606.05345","last_updated":"2026-06-19T19:44:08Z","snapshot_observed_at":"2026-07-06T23:45:23.749718Z","submitted_at":"2026-06-03T18:37:46Z","title":"PJ-RoPE: A Fourier-Jet-Affine Position Space for Relative Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T07:22:20.966483Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2606.05345"},"observation_digest":"sha256:53134fe53ee793343a7b82f652e0638375c2f5472663ff31758dc896e205cdb7","observation_id":"2af03048-6b25-4f6e-b3bc-93e7fba983f3","resolution":{"observed_at":"2026-07-02T06:36:44.000716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2606.30460","last_updated":"2026-06-30T09:40:56Z","snapshot_observed_at":"2026-08-15T11:08:33.213509Z","submitted_at":"2026-06-29T15:26:55Z","title":"HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-30T07:27:34.161517Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2606.30460"},"observation_digest":"sha256:e2300fbe0795519b5fd87e52304b0a5ec42c0c90a44d6ba7b0137e1af3a4a8d3","observation_id":"9a93caa2-d800-4c6c-9803-82d516048794","resolution":{"observed_at":"2026-06-30T07:34:21.743679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":"2309.16039","doi":"10.48550/arxiv.2309.16039","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Oguz, B., et al","venue":"arXiv (Cornell University)","work_id":"100ca4eb-be6f-4510-9c7f-bbb24f10d946","year":2023},"citing_paper":{"arxiv_id":"2606.30460","last_updated":"2026-06-30T09:40:56Z","snapshot_observed_at":"2026-08-15T11:08:33.213509Z","submitted_at":"2026-06-29T15:26:55Z","title":"HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-01T06:58:30.817223Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2606.30460"},"observation_digest":"sha256:ecfe5b391d4ccf8f6f7d59d018920715656277703bd3daf1e02dd0c65e3f81e1","observation_id":"5cd62d5c-7320-4fd9-b90b-e19165b97681","resolution":{"observed_at":"2026-07-01T08:55:35.666180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-02T14:07:53.521077Z","title":"Effective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20448","last_updated":"2026-05-13T15:26:50Z","snapshot_observed_at":"2026-08-15T16:38:23.418466Z","submitted_at":"2026-05-13T15:26:50Z","title":"Domyn-Small: A European 10B Reasoning Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T14:07:53.521077Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2607.20448"},"observation_digest":"sha256:919a281313ac4afb2b8fc349e61183395ec55ba711e04de22d5124213e758696","observation_id":"938a1682-9e9e-4d56-8ed0-cfc9c55d629a","resolution":{"observed_at":"2026-08-02T14:07:53.521077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.16039/citation-record","integrity":"/paper/2309.16039/integrity","json":"/paper/2309.16039/citation-record.json","paper":"/paper/2309.16039"},"outbound":[],"paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:57:02.846476Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 53 inbound Pith citation observations for arXiv:2309.16039."}