{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:233ef2c7c62a372e8668bde7c66c882296b2921f68478171efc812b25989e506","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:07:33.797188Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:17.501214Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-07T14:22:17.501214Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19091","last_updated":"2025-05-25T11:02:01Z","snapshot_observed_at":"2026-08-07T14:18:19.325846Z","submitted_at":"2025-05-25T11:02:01Z","title":"ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:22:17.501214Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2505.19091"},"observation_digest":"sha256:34b6ad7de772e5a9e01c7e010a66c1303f974b48b4788453f0093560cf2144de","observation_id":"ba026d5b-c096-4fd6-9b1d-4d898b9f3da7","resolution":{"observed_at":"2026-08-07T14:22:17.501214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-06T19:26:23.035442Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T21:20:22.146417Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2507.05257"},"observation_digest":"sha256:0b038658a40e81ac8e50aacb3c736b300dc787067873a3b40c53de3400a35e1b","observation_id":"49a3ff40-9ec6-409b-a22a-ef601b0ff7eb","resolution":{"observed_at":"2026-05-16T21:20:22.247235Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-06T19:36:05.732614Z","title":"Nolima: Long-context evaluation beyond literal matching.arXiv preprint arXiv:2502.05167,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05257","last_updated":"2026-06-28T17:25:01Z","snapshot_observed_at":"2026-08-06T19:26:23.035442Z","submitted_at":"2025-07-07T17:59:54Z","title":"Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:36:05.732614Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2507.05257"},"observation_digest":"sha256:424062993e97c5f1ba6c7b8a4fe4a84085472230777391f92cd593123a874fec","observation_id":"c3fd6025-7ed3-48ad-89c3-442289975613","resolution":{"observed_at":"2026-08-06T19:36:05.732614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-06T17:29:59.630413Z","title":"Nolima: Long-context evaluation beyond literal matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10873","last_updated":"2025-07-15T00:24:53Z","snapshot_observed_at":"2026-08-09T05:52:35.091450Z","submitted_at":"2025-07-15T00:24:53Z","title":"From Alerts to Intelligence: A Novel LLM-Aided Framework for Host-based Intrusion Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:29:59.630413Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2507.10873"},"observation_digest":"sha256:acd59b3357f4facdb5fff374d090d35e7af03ea60a267dc122db03b1805db39d","observation_id":"3d985bc1-cec7-44e5-919f-670e01084ff8","resolution":{"observed_at":"2026-08-06T17:29:59.630413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T22:12:56.230603Z","title":"Daye Nam, Andrew Macvean, Vincent Hellendoorn, Bogdan Vasilescu, and Brad Myers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07479","last_updated":"2025-08-10T20:40:24Z","snapshot_observed_at":"2026-08-07T00:34:30.717760Z","submitted_at":"2025-08-10T20:40:24Z","title":"Positional Biases Shift as Inputs Approach Context Window Limits","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:12:56.230603Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2508.07479"},"observation_digest":"sha256:e37b5f731fa1eb981fea7424db48ee859cb361c583a3e93eef5f9564d10943b7","observation_id":"0e1c2769-6ff0-4af4-869d-958632793051","resolution":{"observed_at":"2026-08-05T22:12:56.230603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-03T12:42:31.510188Z","title":"NoLiMa: Long-context evaluation beyond literal matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02023","last_updated":"2026-07-14T21:47:31Z","snapshot_observed_at":"2026-08-08T04:32:46.940287Z","submitted_at":"2026-01-05T11:30:56Z","title":"Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:42:31.510188Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2601.02023"},"observation_digest":"sha256:10273763566558e7963ec42b3b29d1f2d3d1c22d20e885c731384269562cfcf5","observation_id":"7fa9bf73-431d-44e8-9143-c25062bc943f","resolution":{"observed_at":"2026-08-03T12:42:31.510188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T11:33:32.568261Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2601.02780"},"observation_digest":"sha256:c77e51f68aa709641e71fae5d0237f253ee3805580d1ea54a846572d39699030","observation_id":"f8cfe597-103c-4256-9874-a5fd89f8bcdb","resolution":{"observed_at":"2026-05-12T11:33:32.850729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2601.21468","last_updated":"2026-05-18T07:50:29Z","snapshot_observed_at":"2026-08-04T01:48:38.560710Z","submitted_at":"2026-01-29T09:47:17Z","title":"MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T15:15:22.055616Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2601.21468"},"observation_digest":"sha256:f2b009546688b929051463fd65522e419cdd7d893a0ace8dd554b92a2b07b7a6","observation_id":"ebb45a47-5775-4c01-b8c5-d78baffdbaa6","resolution":{"observed_at":"2026-05-21T15:20:17.559167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2603.13091","last_updated":"2026-04-17T08:06:30Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-03-13T15:40:42Z","title":"Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T11:28:29.772341Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2603.13091"},"observation_digest":"sha256:c30d4bcc4dd22c8977ddb5c0ee321af704447d11a2deef3661c71581312a7afd","observation_id":"822a91a7-5d57-4656-8c1d-38e28f447256","resolution":{"observed_at":"2026-05-15T11:29:58.743708Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2604.05151","last_updated":"2026-04-06T20:25:20Z","snapshot_observed_at":"2026-07-06T22:53:55.926521Z","submitted_at":"2026-04-06T20:25:20Z","title":"Context Collapse: Barriers to Adoption for Generative AI in Workplace Settings","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:18.436603Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2604.05151"},"observation_digest":"sha256:6b0401cc79e03d2cfe66255cec12217b21c5882735247ff0a439c3480f554747","observation_id":"c5068b9f-7f3f-4881-9c34-727a206c78a0","resolution":{"observed_at":"2026-05-10T23:35:52.613651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2604.21816","last_updated":"2026-04-23T16:10:00Z","snapshot_observed_at":"2026-08-06T16:02:59.994323Z","submitted_at":"2026-04-23T16:10:00Z","title":"Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T21:44:15.689372Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2604.21816"},"observation_digest":"sha256:086e2dcec24465f66a6863eca6dfff920cc93d11cf88fc5fc8a6c3f0bb96d4b1","observation_id":"b8927049-1f1f-4337-b37f-0f8e46c533fb","resolution":{"observed_at":"2026-05-11T14:31:05.398766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T14:44:21.325977Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:2f27760f9b0ca18c9b69e3c33f51b59e8a0f5fbb27600d52eb7e8895f3ec1997","observation_id":"da8a7ff6-c924-4d3b-8f91-96429dcce240","resolution":{"observed_at":"2026-05-11T18:41:10.616551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.05806","last_updated":"2026-05-08T05:21:54Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:42:28Z","title":"Retrieval from Within: An Intrinsic Capability of Attention-Based Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:11.473175Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.05806"},"observation_digest":"sha256:42414da107136e845022f4f94cf60de6201d24b1add88799da7e2b5a90c454a0","observation_id":"eea11f69-7032-4e69-a4f3-53fd3763f342","resolution":{"observed_at":"2026-05-11T04:50:55.374291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.08580","last_updated":"2026-05-09T00:47:43Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T00:47:43Z","title":"Slipstream: Trajectory-Grounded Compaction Validation for Long-Horizon Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T01:04:55.618417Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.08580"},"observation_digest":"sha256:c15608c2b33e9a8827515e43484e9beaeba04d20af4127d1158fa69380e6cace","observation_id":"afa493ee-83e4-488e-9a27-75874489c4c6","resolution":{"observed_at":"2026-05-12T01:06:13.421804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.10544","last_updated":"2026-05-11T13:23:21Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:23:21Z","title":"Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T03:52:45.320454Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.10544"},"observation_digest":"sha256:5fe83b80984e1c53e62fb6672dbad581eb410b9a285627a3c8ebd45f5f90cc66","observation_id":"01fa599f-4bba-477e-b716-7d662e871328","resolution":{"observed_at":"2026-05-12T06:51:29.109575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.23170","last_updated":"2026-05-22T02:42:41Z","snapshot_observed_at":"2026-08-03T03:47:34.013785Z","submitted_at":"2026-05-22T02:42:41Z","title":"Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-25T04:58:15.184063Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.23170"},"observation_digest":"sha256:a9b915523bba51e84a16e2ff71b41def8754c91f8ef265f7a3ac0d32c328e55d","observation_id":"96bd3231-b603-4dce-a24b-ac1144e570f4","resolution":{"observed_at":"2026-05-25T05:00:21.860068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.23296","last_updated":"2026-05-22T07:12:38Z","snapshot_observed_at":"2026-08-03T12:39:26.370886Z","submitted_at":"2026-05-22T07:12:38Z","title":"Parallel Context Compaction for Long-Horizon LLM Agent Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T04:36:22.084650Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.23296"},"observation_digest":"sha256:10e522552453f77fb4fb71181d143280aca41a42d68fa95ce6151c9f8ee1a230","observation_id":"03381e0a-2bbe-48e6-b3c7-f1bcca845d58","resolution":{"observed_at":"2026-05-25T04:36:36.608423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.24279","last_updated":"2026-05-22T23:13:21Z","snapshot_observed_at":"2026-07-31T10:30:03.841807Z","submitted_at":"2026-05-22T23:13:21Z","title":"ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T15:17:37.904831Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.24279"},"observation_digest":"sha256:83a435cdac66fc3baff048456ccd6c5a3d7532396b8a81456d6fc07955dc32fe","observation_id":"e680f4fa-dea6-4634-b40a-2ea29b31ef26","resolution":{"observed_at":"2026-06-30T15:34:48.486069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2605.27294","last_updated":"2026-05-26T17:06:55Z","snapshot_observed_at":"2026-08-02T03:53:51.505758Z","submitted_at":"2026-05-26T17:06:55Z","title":"Separating Semantic Competition from Context Length in RAG Reading","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T17:56:05.596190Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2605.27294"},"observation_digest":"sha256:d3997908b653b598acc74036068089e622df41c1a73f6c4bf1a0c131b8ef1eca","observation_id":"75280bb5-728d-4dfd-983b-4d1b7922e2f2","resolution":{"observed_at":"2026-06-29T18:03:48.173672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2606.02963","last_updated":"2026-06-01T23:48:55Z","snapshot_observed_at":"2026-08-08T06:51:42.062018Z","submitted_at":"2026-06-01T23:48:55Z","title":"KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:02:47.349477Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2606.02963"},"observation_digest":"sha256:e387136e27fb33c75c910ae007c95f57fb0d30b6334590ca17da07b85e0846df","observation_id":"5a26e4c8-dbbd-4d53-ad38-093d68e8730d","resolution":{"observed_at":"2026-07-01T22:46:19.684811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2606.04660","last_updated":"2026-06-03T09:37:25Z","snapshot_observed_at":"2026-08-01T20:57:34.799181Z","submitted_at":"2026-06-03T09:37:25Z","title":"LifeSide: Benchmarking Agents as Lifelong Digital Companions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T06:42:55.108719Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2606.04660"},"observation_digest":"sha256:5a92605fdc57772cafb5d55b9d9c07e6339f562f460ef49b1ce2c4693fe604b3","observation_id":"a2501fa4-2a6a-4826-901b-c85e3d308ca2","resolution":{"observed_at":"2026-07-02T07:46:46.116061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:1440b118078e19676ad91b9bf75d7db3587b44681744ac31b4d736a8e6a52784","observation_id":"aa527bb7-cc01-4766-9226-99b29e52e80c","resolution":{"observed_at":"2026-06-27T22:31:21.412334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2606.06906","last_updated":"2026-06-05T04:49:37Z","snapshot_observed_at":"2026-08-02T10:42:01.638389Z","submitted_at":"2026-06-05T04:49:37Z","title":"EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T22:05:00.537690Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2606.06906"},"observation_digest":"sha256:a409993e3586ea82dd735487fc326e7a2d83b430902901e9179a1736f2da2cb8","observation_id":"61b06e64-cbc2-4a9a-aa87-b5e910571d39","resolution":{"observed_at":"2026-07-02T17:17:15.125201Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":"2502.05167","doi":"10.48550/arxiv.2502.05167","metadata_source":"pith","pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Yoon, Seunghyun and Sch","venue":"cs.CL","work_id":"2b2c5be0-90c9-4121-b56f-41f2f5d57ecb","year":2025},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:6466e35e9784f5b8f0760dad8e1dae4681932bd34ed0a0c40adc14ab33286ee3","observation_id":"3006c052-3bf8-4124-aff9-f5bb0270388e","resolution":{"observed_at":"2026-07-10T01:36:43.995595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2502.05167 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-07T19:26:40.944900Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:0665a95964bcc869d1ace91370e982bbc91aedc3c59e161f5dc73686d49d7923","observation_id":"7aaa31c2-7101-41a3-954f-e04bd9740c6b","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-01T04:48:27.492158Z","title":"arXiv:2502.05167","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22448","last_updated":"2026-07-27T23:08:28Z","snapshot_observed_at":"2026-08-08T03:02:00.797726Z","submitted_at":"2026-07-24T16:10:21Z","title":"Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T04:48:27.492158Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2607.22448"},"observation_digest":"sha256:5c1eaf7143f1f6e3dd067954a8dfea6ab5a08649020a4a0d15caa94b9c974f90","observation_id":"6be85427-c3b4-414b-8998-b3301b7383e5","resolution":{"observed_at":"2026-08-01T04:48:27.492158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-01T15:05:51.135681Z","title":"Rossi, Seunghyun Yoon, and Hinrich Schütze","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22711","last_updated":"2026-07-20T23:01:39Z","snapshot_observed_at":"2026-08-07T05:51:42.910790Z","submitted_at":"2026-07-20T23:01:39Z","title":"CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:05:51.135681Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2607.22711"},"observation_digest":"sha256:26379e882c630f79bf99c3809684b4a4b2e68d586cf70d1ea5c79d3b5dd8c512","observation_id":"144aee59-b3cf-4cbf-b526-4207cec02b4e","resolution":{"observed_at":"2026-08-01T15:05:51.135681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05167","snapshot_observed_at":"2026-08-01T02:36:08.596712Z","title":"Modarressi, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25398","last_updated":"2026-08-03T20:36:31Z","snapshot_observed_at":"2026-08-07T23:09:37.718671Z","submitted_at":"2026-07-28T07:58:07Z","title":"HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:36:08.596712Z"},"links":{"cited_paper":"/paper/2502.05167","citing_paper":"/paper/2607.25398"},"observation_digest":"sha256:3b168e26a1e22f3e099558fba1b952f55e1a81dfa2a74e51e5620fb28a0d4951","observation_id":"1428011f-2a66-4d73-8bba-2b7221fe30af","resolution":{"observed_at":"2026-08-01T02:36:08.596712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05167/citation-record","integrity":"/paper/2502.05167/integrity","json":"/paper/2502.05167/citation-record.json","paper":"/paper/2502.05167"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.592598Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.592598Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:9352f108bdaf60d6bb17d07bafcfb2310b0b3c7eeb83b3e5d21f8f0f5ce5060e","observation_id":"2a14e8e5-e940-4aa9-8355-6d9095d382ee","resolution":{"observed_at":"2026-08-08T20:07:33.592598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.637774Z","title":"M., Bohnet, B., Rosias, L., Chan, S","venue":null,"work_id":"eb8922ae-2d9d-47d3-b5a9-f44c79b53e03","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.598942Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:ab14c74259549902d1c8ff1c3daa514f4632780038e60f89940b9c63689b77d8","observation_id":"173c4c31-33e3-41c3-8177-b63e5216be83","resolution":{"observed_at":"2026-08-08T20:07:34.642362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.603825Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.603825Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:d5ade40a2f68dad36ca94928ca1635c1827659716052262b185fa36aca86a349","observation_id":"f5299136-3f17-410b-be2d-6027c9914ce7","resolution":{"observed_at":"2026-08-08T20:07:33.603825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.611523Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"f996dd09-8f4c-4eb5-8bf2-57dad325a0ae","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.608952Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:be907bf852c6b163f161831480769a32b14d07efbdcbd270ae9e7837340ff82a","observation_id":"a998d468-284c-4cef-9727-eec3fa264fdb","resolution":{"observed_at":"2026-08-08T20:07:34.616107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.613359Z","title":"E., Mnih, V., Leibo, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.613359Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:2ef9d1cc6f7731bb9d057298b51032d8c07c3d10afe0ca2b7ac520fc0571e677","observation_id":"54cf8e90-7a22-4c59-9698-9901626cefed","resolution":{"observed_at":"2026-08-08T20:07:33.613359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.617862Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.617862Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:77cd0744bba2b3a750ca2741672fee78ce0d168e44c49554dcec926f1f710710","observation_id":"9dd5cff6-1f4b-4b5e-add3-1eca2b3e40b8","resolution":{"observed_at":"2026-08-08T20:07:33.617862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.583857Z","title":"Booookscore: A systematic exploration of book-length summarization in the era of LLM s","venue":null,"work_id":"31217457-97d5-49ce-806b-2cedd981cbe7","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.622621Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:cdab0e1856e866df3deb25498836cd825034ef9f2bac384f5795cd6b4fada878","observation_id":"fc3f35dd-9072-4cd8-ac73-51d5643ce929","resolution":{"observed_at":"2026-08-08T20:07:34.589134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-08T20:07:33.627669Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.627669Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:e6d43f75d79c470f35b2f3d24e160d2da1486f249f738cfed8585410d5286419","observation_id":"29bb0b64-13fb-4439-a9d7-614c8e44e91b","resolution":{"observed_at":"2026-08-08T20:07:33.627669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.568835Z","title":"c4ai-command-r-plus-08-2024, 2024","venue":null,"work_id":"f532a427-398f-46c9-ad9e-12b7b41e2648","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.632317Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:9586ed1e740a860933a3629a5303d5a9898752ee628349b2bfd01511e7c08e89","observation_id":"6735a852-b89f-4106-b095-89e10c83012b","resolution":{"observed_at":"2026-08-08T20:07:34.573388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T20:07:33.636486Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.636486Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:9c78af0c32cea8a227c27c258fd7a35279a66f734c0b93bec1d92a362623bd34","observation_id":"fdaa6f2e-312c-4c9b-8bb2-468681b095c5","resolution":{"observed_at":"2026-08-08T20:07:33.636486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.552996Z","title":"X., and Wen, J.-R","venue":null,"work_id":"7d1ccb02-0020-4578-bccd-59b6e65c8e47","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.641111Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:0f18c885dbf361e7b3596dfe1559357f5e147edb22d4abd272d1d0cd708d50eb","observation_id":"124b99d0-b237-4587-b0f3-a6e86130ca78","resolution":{"observed_at":"2026-08-08T20:07:34.557958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T20:07:33.645488Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.645488Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:1b819b6a776b20949b09be204bab0e6ce02543199e3281f3b11fde7442d75bb7","observation_id":"e3fb69c7-51d9-4256-922e-688b34946c76","resolution":{"observed_at":"2026-08-08T20:07:33.645488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.649807Z","title":"Is it really long context if all you need is retrieval? towards genuinely difficult long context NLP","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.649807Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:4467a72b12e4c3842df95480de0f574a8e8dc4396626d4608a9b2374cee7b931","observation_id":"e167a8a6-8813-4263-8588-15969d5b02b7","resolution":{"observed_at":"2026-08-08T20:07:33.649807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-01T22:22:04.725773Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-08T20:07:33.654022Z","title":"Neural turing machines, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.654022Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:bbd84068f723a2eee18004f3505a5894718170d5e426a6e1e87c083ea40185ab","observation_id":"e593d0f3-309c-478e-bcc3-cef08e0a1cf3","resolution":{"observed_at":"2026-08-08T20:07:33.654022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10151","last_updated":"2024-08-19T17:02:06Z","snapshot_observed_at":"2026-08-09T07:54:12.583479Z","submitted_at":"2024-08-19T17:02:06Z","title":"Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10151","snapshot_observed_at":"2026-08-08T20:07:33.658485Z","title":"Multilingual needle in a haystack: Investigating long-context behavior of multilingual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.658485Z"},"links":{"cited_paper":"/paper/2408.10151","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:aa62433a420a073597150a978604bfd7a94a02859e926c019f0de70c74cf4aef","observation_id":"1c05ec9c-879e-4756-9d04-ba84c2b8984c","resolution":{"observed_at":"2026-08-08T20:07:33.658485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.663325Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.663325Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:04e138c2bc6b8508ad3a151fff5804973f03970ce8d73027ab08d72fd57d5b7c","observation_id":"3e3c721b-caad-46b8-a5c5-a33f7efa2d4a","resolution":{"observed_at":"2026-08-08T20:07:33.663325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T20:07:33.667798Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.667798Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:725df7092847a603556a006e5483fcf86d35f1693ab4b02a238b1e932252a89e","observation_id":"5f1399f4-2895-4cdd-a258-9ccaa8e5c1bd","resolution":{"observed_at":"2026-08-08T20:07:33.667798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.527489Z","title":"Unsupervised dense information retrieval with contrastive learning","venue":null,"work_id":"3273b29c-b4fe-4c13-b444-cdcd504549ce","year":2022},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.672794Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:7020aa100b9c0e7e129504830f893f1d20ff210b4e6a90415b30a36793512dae","observation_id":"54347c29-18a5-4c8c-84c2-9e1e822b28da","resolution":{"observed_at":"2026-08-08T20:07:34.532417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.677277Z","title":"J., Taylor, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.677277Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:61d461b129165d04031b4f6150a61323840a8d82871be184eb6aa784d848f77e","observation_id":"a671bd00-4858-4793-816d-fc1b0e9bd21c","resolution":{"observed_at":"2026-08-08T20:07:33.677277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.510564Z","title":"Needle in a haystack-pressure testing llms","venue":null,"work_id":"05aab62b-4985-4957-b273-b36388b5787b","year":2023},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.682949Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:a54602d0340222a6df402745aea4c05bbc148f8b7e3d494895c09f7f229a5e64","observation_id":"2109e06f-d3ba-43db-abd2-4e64838141f4","resolution":{"observed_at":"2026-08-08T20:07:34.516136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.495494Z","title":"S., Reid, M., Matsuo, Y., and Iwasawa, Y","venue":null,"work_id":"e9dd0a64-2fee-465a-817f-ceae521400a6","year":2022},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.687443Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:478ea919b0f72b5a0a6fb4c7ca9833f45a9b2447c165bd37018ad4cc5d7368b4","observation_id":"2765d5ce-25fa-4914-b20c-f8f223401e45","resolution":{"observed_at":"2026-08-08T20:07:34.499918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.480455Z","title":"I., Sorokin, A., and Burtsev, M","venue":null,"work_id":"0287de56-1ebf-4d2b-bd76-3647064bef13","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.691753Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:1b023f8be1cdf0ca2c0d5506428eb5e6081cb3acb30c5aa7907e64637b319db7","observation_id":"33b54eb3-ff1b-4d06-a727-27a311300fa0","resolution":{"observed_at":"2026-08-08T20:07:34.484943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.696215Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.696215Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:31294a268e3d82436b79a3866d6fe502db20e34edd753f9cf83377a2d7af9657","observation_id":"a1d88382-70ec-43b2-b28d-7542a6d8e741","resolution":{"observed_at":"2026-08-08T20:07:33.696215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13121","last_updated":"2024-06-19T00:28:58Z","snapshot_observed_at":"2026-07-06T18:33:24.206083Z","submitted_at":"2024-06-19T00:28:58Z","title":"Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13121","snapshot_observed_at":"2026-08-08T20:07:33.700371Z","title":"S., Boratko, M., Luan, Y., Arnold, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.700371Z"},"links":{"cited_paper":"/paper/2406.13121","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:8a953622625052787edd3280427c0f32c0ce6b7782c4a0f9928dbc5b920df381","observation_id":"74a1b7f6-5598-4845-bfb2-62b2bba3eced","resolution":{"observed_at":"2026-08-08T20:07:33.700371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.704728Z","title":"Same task, more tokens: the impact of input length on the reasoning performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.704728Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:3fe45601ecac1898aeb797bbd4e361187adbd9b16603d283eb95e67977ecc87a","observation_id":"0b8bdee4-a411-45b7-ae77-26d0e427c0ee","resolution":{"observed_at":"2026-08-08T20:07:33.704728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.709382Z","title":"Needlebench: Can llms do retrieval and reasoning in 1 million context window?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.709382Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:7031a7de8838b8053e19cf315342fe75558ad8239c338a71dd07abc4f25229b0","observation_id":"c6a152d2-ce70-478b-bffc-493308f22204","resolution":{"observed_at":"2026-08-08T20:07:33.709382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.713886Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.713886Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:d473357190c56407463ac8431ced99caa9bb8d0952fd662d05fe84448f9d157d","observation_id":"415d5cc6-337a-461e-8aac-dd758d1bba8b","resolution":{"observed_at":"2026-08-08T20:07:33.713886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.718306Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.718306Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:93924686889e11183f40d43ccf1311e0f036a312a451be00b42a55a669976818","observation_id":"03602941-5f36-4afb-bdec-06d167f77f77","resolution":{"observed_at":"2026-08-08T20:07:33.718306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.722803Z","title":"Evaluating very long-term conversational memory of LLM agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.722803Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:d0795d31629d6ece799ce83e32003a741b2387df52f8756d526ada970a8312ce","observation_id":"6c9ca1ef-a75a-4bb0-83d4-c6daba0b390d","resolution":{"observed_at":"2026-08-08T20:07:33.722803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.443626Z","title":"Llama 3.3 model card","venue":null,"work_id":"5588a6cd-cf75-4440-a222-452eefcb7143","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.727378Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:d131b204343d8e0cf4d1bc453e2714fedc60bad0cfaa301389c481419790c91d","observation_id":"8d3d75cd-eccb-4f16-83b0-70004517f339","resolution":{"observed_at":"2026-08-08T20:07:34.448376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.428902Z","title":"Mistral large 2","venue":null,"work_id":"32a89df3-96b4-4e13-bd0f-dd0544326e1c","year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.731713Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:910a3af063af1e4f247006cffd79ce81303dd622ff7a8841c3d27730c683afbd","observation_id":"6c9e4c0e-e819-49e5-afc9-7dce550a622e","resolution":{"observed_at":"2026-08-08T20:07:34.433216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.413626Z","title":"and Jaggi, M","venue":null,"work_id":"091290bc-5ee7-4b6c-9201-b4dfbb8a2a38","year":2023},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.735841Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:9129e5c236f29eb3df1bfdec74006af923b10dd9406c5bac13d777a57a4c2997","observation_id":"858afd15-72f3-43e8-8eca-e23909d8a962","resolution":{"observed_at":"2026-08-08T20:07:34.417927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.739849Z","title":"Biases in large language models: Origins, inventory, and discussion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.739849Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:c0b61f15bd1fc62053e3fb4028f518f377df373fb4569d5caec0769703b86ba8","observation_id":"54c0df92-392e-49ab-818d-a7af43f37745","resolution":{"observed_at":"2026-08-08T20:07:33.739849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-08T20:07:33.744359Z","title":"In-context learning and induction heads, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.744359Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:2b7f7b1f0e2f189fa71f9d95050e737d24d42aaa5a32f6db6a4390f215b0cc27","observation_id":"ab5d9051-ec2e-425f-b55a-9fade2186663","resolution":{"observed_at":"2026-08-08T20:07:33.744359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.398132Z","title":"Openai o3-mini system card","venue":null,"work_id":"6005c730-1d5b-4529-b11d-e7ec9fa25e31","year":2025},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.748962Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:58802c7fb970fd8b195cdab2c199e5ec21033733cf0db5d32b08447d94231bab","observation_id":"e010c381-3a1c-46b0-8ed4-3132f81b9506","resolution":{"observed_at":"2026-08-08T20:07:34.403138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T20:07:33.753502Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.753502Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:bd70d41e62a2309cc9fe47cc7376aaf3b6f9d5a4b7fa5d5f098858089402688e","observation_id":"63e94e1e-3d22-4f09-9853-d24b343a0be0","resolution":{"observed_at":"2026-08-08T20:07:33.753502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.758028Z","title":"Ya RN : Efficient context window extension of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.758028Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:9e21f0ecc5eb52c6a4b9cc255720138c6b73463453140025ef2ffe843852f5e8","observation_id":"503de85d-0ccc-4c78-8803-fd896013e744","resolution":{"observed_at":"2026-08-08T20:07:33.758028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.762381Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.762381Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:5c26a0e54ee755496e02263f77562ee460e5f50faba186eefeb240f757574559","observation_id":"0111a5d6-db4f-44e7-81b8-c207018617e7","resolution":{"observed_at":"2026-08-08T20:07:33.762381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T20:07:33.766626Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.766626Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:4cafe48819b2fca84aa71d65dc51cdb10e9526a307ed937d643a05d2e66ba059","observation_id":"fad157b5-337f-4d21-a24b-3c112e0c64a0","resolution":{"observed_at":"2026-08-08T20:07:33.766626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12570","last_updated":"2024-08-22T17:38:59Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:38:59Z","title":"Jamba-1.5: Hybrid Transformer-Mamba Models at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12570","snapshot_observed_at":"2026-08-08T20:07:33.771026Z","title":"Jamba-1.5: Hybrid transformer-mamba models at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.771026Z"},"links":{"cited_paper":"/paper/2408.12570","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:f3e485abbb834a6eed6ed9ff3f414f02b1e067ae6298eb18ac81e95601eef308","observation_id":"4b6c1206-f5ce-43cd-bdaa-a5747401dbd8","resolution":{"observed_at":"2026-08-08T20:07:33.771026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.775267Z","title":"Leave no document behind: Benchmarking long-context LLM s with extended multi-doc QA","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.775267Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:88b02388030c23e3e58ca88555048590296847b0790d21bc922a3429ee9f015b","observation_id":"ccf53462-1c47-49b6-a4f7-44a843011a39","resolution":{"observed_at":"2026-08-08T20:07:33.775267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:34.361717Z","title":"V., and Zhou, D","venue":null,"work_id":"c9ce0893-bbef-4a15-9c5d-5348ae308ed4","year":2022},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.779724Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:402ed7a32b6d311f05fdab7294ef8df3f67886b072c86b0f5952c1b9c0777910","observation_id":"aaeee15f-17da-422d-b98e-a1520428f6b7","resolution":{"observed_at":"2026-08-08T20:07:34.367091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.783846Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.783846Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:451103e328155fd7335459bff4eaea7d8195ed23752b990541de83ae78a2a9a8","observation_id":"c9cc6fdd-95be-4b47-81d7-4328c1330e83","resolution":{"observed_at":"2026-08-08T20:07:33.783846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:07:33.788339Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.788339Z"},"links":{"citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:b551159980900fa00d45394ec3cd57a6cd0bc1dfbbe94e2284eb0e0579545691","observation_id":"0118dd4f-d622-4e83-903a-0ef6c525c28f","resolution":{"observed_at":"2026-08-08T20:07:33.788339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-06T10:41:12.245173Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-08T20:07:33.792487Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.792487Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:a605fdb8c75e1cbdc0460e9c6c0448c3213ae7f4f931bfacde01b52236a78034","observation_id":"a61a6ba2-5a9d-4e63-bf3a-bf0dfeedc3fe","resolution":{"observed_at":"2026-08-08T20:07:33.792487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-02T23:59:10.592798Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-08T20:07:33.797188Z","title":"K., Han, X., Thai, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T20:07:33.797188Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2502.05167"},"observation_digest":"sha256:5b4f487fa2dbcb27e572b4a913c636954f7fdc4a65bd2edd6c5f65a1e35517f4","observation_id":"613c0194-d071-4128-8a77-b9f1fd881478","resolution":{"observed_at":"2026-08-08T20:07:33.797188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05167","last_updated":"2025-07-09T14:35:23Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T19:59:08.845558Z","submitted_at":"2025-02-07T18:49:46Z","title":"NoLiMa: Long-Context Evaluation Beyond Literal Matching"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 28 inbound Pith citation observations for arXiv:2502.05167."}