{"as_of":"2026-08-10T13:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:351e43b2a1aba6617802d0a61d6e54133c50ac42928e0af1ba84ee12b9078a8b","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:31:45.191937Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02000/citation-record","integrity":"/paper/2506.02000/integrity","json":"/paper/2506.02000/citation-record.json","paper":"/paper/2506.02000"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-09T07:56:50.464493Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T15:31:42.196733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.196733Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5032381691da721a182cdeb3690f3212325430cea80784e6f7114488dbb3a72a","observation_id":"bdf90adb-491d-4380-8de7-725ff8812b0c","resolution":{"observed_at":"2026-08-07T15:31:42.196733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.916268Z","title":null,"venue":null,"work_id":"b53646da-82d9-41f6-ba49-7fb0b80c3e76","year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.259177Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:822bbf5a6e19aba8696a2b628fc6d4e56381437417a0aaee67ce9f08fbc6b482","observation_id":"4bfa2222-e7cb-441d-981c-dda2d9e3b3a4","resolution":{"observed_at":"2026-08-07T15:31:48.981200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T15:31:42.323817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.323817Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:1ec23da85bb38d4ad21fe86efbdfcbff85ed32a2b97e3baa63ffc38b1ac06d31","observation_id":"6a246a3d-f5e8-40bc-a3c9-31178427557d","resolution":{"observed_at":"2026-08-07T15:31:42.323817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T15:31:42.391811Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.391811Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:42963cbee55c47daaad3cf461263ff415cfd15d80fce91ed7b2bdde567947ccd","observation_id":"9cca8458-b8f9-41d0-8186-0a909cd0acc8","resolution":{"observed_at":"2026-08-07T15:31:42.391811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-07T15:31:42.483574Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.483574Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f0d1f4d8006e55a750fbe7eaa24b1cde29d80cde96ca0126f5d5614d1dab456d","observation_id":"cd6a0f39-8641-449a-b3e6-64e5d9eb0c55","resolution":{"observed_at":"2026-08-07T15:31:42.483574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.658227Z","title":null,"venue":null,"work_id":"da580fa7-63a2-4aa5-ac42-22c0fbb2651e","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.578742Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5481c65c33636cb6c244ce038ba4cd5190bd716db5d426b37f40c514bc516248","observation_id":"f582631c-bdcd-4b32-91b4-cfe7c5b2df20","resolution":{"observed_at":"2026-08-07T15:31:48.792392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.416532Z","title":null,"venue":null,"work_id":"c4f99446-8fb1-40c5-a950-85cff1d21b05","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.681448Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5813c645a32b5e055f9d2e10bc4ecfd6afd897d20ace5bcee75dcf53e913dce5","observation_id":"4ca6d699-4ec4-4609-8dd3-3d697496675a","resolution":{"observed_at":"2026-08-07T15:31:48.484142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T15:31:42.756912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.756912Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:4bf1125eea96a11f10446a14e85fa128d7082ed18b5ad0aaa07a8cfb6c5ce255","observation_id":"071381ea-b736-4724-b2e0-c4d4e06a518d","resolution":{"observed_at":"2026-08-07T15:31:42.756912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07100","last_updated":"2025-02-25T23:48:33Z","snapshot_observed_at":"2026-08-09T14:48:44.583884Z","submitted_at":"2025-02-25T23:48:33Z","title":"EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07100","snapshot_observed_at":"2026-08-07T15:31:42.825940Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.825940Z"},"links":{"cited_paper":"/paper/2504.07100","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:4bce7168bc73831d7feacc48bc1670c40861126d0d280a982fdcd3725d751d8b","observation_id":"75c8e2a6-0592-48b2-b12b-00e8ac1a680e","resolution":{"observed_at":"2026-08-07T15:31:42.825940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:42.900418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.900418Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:d9735fe13a04ba52353307c1891dfdb0daccaca1acfd6e4cdef98ce2675f2ff7","observation_id":"f1fee9ab-7475-48f8-a9c8-70c0d1062e74","resolution":{"observed_at":"2026-08-07T15:31:42.900418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.146949Z","title":null,"venue":null,"work_id":"edd05ca8-127d-4a18-8725-929bcdfe8bfe","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.958223Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:7a429805022fcb4cdbf88c88677f66096de2e4838cb34bddf07cb900e2940bc3","observation_id":"06748e38-5412-4ddc-bcb9-28dadad64678","resolution":{"observed_at":"2026-08-07T15:31:48.292313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T15:31:43.018867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.018867Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:76b4f73ee86c97b4c215f9c79a68d10b3f9d5a029f46c59876b28485a880a49b","observation_id":"37e3e0ab-b28e-4f8d-ab60-48725b56b11a","resolution":{"observed_at":"2026-08-07T15:31:43.018867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16264","last_updated":"2024-10-22T15:09:58Z","snapshot_observed_at":"2026-08-06T16:33:35.827574Z","submitted_at":"2024-06-24T02:03:57Z","title":"One Thousand and One Pairs: A \"novel\" challenge for long-context language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16264","snapshot_observed_at":"2026-08-07T15:31:43.077816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.077816Z"},"links":{"cited_paper":"/paper/2406.16264","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:3ff96aaacdb2d46aca3eede0ba10c7457bc5855ee14f360cac99c9cb3473febe","observation_id":"041d8801-d5db-41c0-acae-fa4c3265b030","resolution":{"observed_at":"2026-08-07T15:31:43.077816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07040","last_updated":"2017-12-19T16:48:05Z","snapshot_observed_at":"2026-07-31T01:20:29.856066Z","submitted_at":"2017-12-19T16:48:05Z","title":"The NarrativeQA Reading Comprehension Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07040","snapshot_observed_at":"2026-08-07T15:31:43.137091Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.137091Z"},"links":{"cited_paper":"/paper/1712.07040","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:e0c5ce0ebe067168d021cd348c08094b1ddba7de9da7d47d1cb61ca37a8a838d","observation_id":"e0e4f0b7-fa54-45f8-98ff-be9aacc1dd34","resolution":{"observed_at":"2026-08-07T15:31:43.137091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10149","last_updated":"2024-11-06T14:50:40Z","snapshot_observed_at":"2026-08-09T01:19:53.754048Z","submitted_at":"2024-06-14T16:00:29Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10149","snapshot_observed_at":"2026-08-07T15:31:43.210471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.210471Z"},"links":{"cited_paper":"/paper/2406.10149","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:c27514d6dfeaedb6135e8faaa9e48873832d912544a41cca12bab44bfb0eb107","observation_id":"37534588-8791-4d18-a9c2-29caca12fa5e","resolution":{"observed_at":"2026-08-07T15:31:43.210471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-07T15:31:43.267912Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.267912Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:1cc23032920ac98c30daadc91f5b0428f6a63303538ee62f5d9d03c3827543c3","observation_id":"fbefefc8-41f3-446a-9377-e2ec961d736b","resolution":{"observed_at":"2026-08-07T15:31:43.267912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-08T11:14:21.904860Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-07T15:31:43.324780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.324780Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:a41740c88f29d530a5419583067b67f6909634dd6dbc3fafeeb7df0091380c10","observation_id":"15cd5cb7-6c85-4d8e-998e-4bf9a0f4ecde","resolution":{"observed_at":"2026-08-07T15:31:43.324780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:43.379678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.379678Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:377a22196b7f455221be3cc9f22cf528dc868f22c2b66f940949b602b8016169","observation_id":"82393d29-4155-4ee5-88d5-97d148794423","resolution":{"observed_at":"2026-08-07T15:31:43.379678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03246","last_updated":"2024-08-06T15:06:40Z","snapshot_observed_at":"2026-07-06T18:57:31.323769Z","submitted_at":"2024-08-06T15:06:40Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","version":1},"cited_work":{"arxiv_id":"2408.03246","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03246","snapshot_observed_at":"2026-08-07T15:31:45.878386Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","venue":"cs.CL","work_id":"d8a93ca4-4608-4840-ae6e-645ac377065b","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.438051Z"},"links":{"cited_paper":"/paper/2408.03246","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:2cfe1a88ce500f1839bd44795fe840400a9dc45040a314724aa3ce781989eaa1","observation_id":"48ac52bb-5647-451b-98ea-0052fb0bfbf5","resolution":{"observed_at":"2026-08-07T15:31:46.057841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T15:31:43.593760Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.593760Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:9d747a34bb2b05423ef4502318e9d54beb36f7b947aff4b29a1b0bc998a26b39","observation_id":"83efaa79-557c-479d-8e13-c36d6c8758f4","resolution":{"observed_at":"2026-08-07T15:31:43.593760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:47.746737Z","title":null,"venue":null,"work_id":"39e4babb-3153-49fc-9b19-2ac5b7b1ccb5","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.665498Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:e7796e9489716e9c12c372972bc3b24922ceb55f88e12919df319ad2a98b7322","observation_id":"dd451ad6-6fed-415e-bc01-b57e1d81c82e","resolution":{"observed_at":"2026-08-07T15:31:47.972259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:31:43.724505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.724505Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:952df95c1fbea97860f83e69de15cc98ecf627b604783b31e77ca6b02eef7365","observation_id":"f01e73c1-716e-4e4c-a9cd-3dde364aaf0d","resolution":{"observed_at":"2026-08-07T15:31:43.724505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:47.378766Z","title":null,"venue":null,"work_id":"c86d8ed0-82d5-49e2-8bf1-20f5bd2fb99c","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.810014Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:011281e67fa3ce225200533037eaea51e300bb8798efca019e4c5bdabed0ae9c","observation_id":"67c01229-56bb-4924-a0dc-e91351698c36","resolution":{"observed_at":"2026-08-07T15:31:47.557596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:46.969994Z","title":null,"venue":null,"work_id":"2aba4373-a114-4480-91e9-817deeecf76e","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.875143Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5cc90f97d545a558f6aa39102d40e620460f7f5c316aeccb5320aa29998ef642","observation_id":"de9afda2-7828-471d-a59d-7f08b679dea1","resolution":{"observed_at":"2026-08-07T15:31:47.160960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08608","last_updated":"2022-05-11T04:59:10Z","snapshot_observed_at":"2026-08-04T03:33:22.619513Z","submitted_at":"2021-12-16T04:14:38Z","title":"QuALITY: Question Answering with Long Input Texts, Yes!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08608","snapshot_observed_at":"2026-08-07T15:31:43.967050Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.967050Z"},"links":{"cited_paper":"/paper/2112.08608","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f4fd03a100ba89a18cdd3199f771a978e3206ef4ffd28db23457e5e57a4245a4","observation_id":"7ac20032-db84-4839-b3d8-6f59f3fbc621","resolution":{"observed_at":"2026-08-07T15:31:43.967050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:46.681244Z","title":null,"venue":null,"work_id":"f5172d2d-b9e9-4226-af4a-661b22675d3e","year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.038710Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:3a9c728d6c299a812292e7af1b659bf50463d3c7e7e0228902564be6fc2e90ca","observation_id":"25f096e5-05cd-4146-bdfb-a0e5a630a30c","resolution":{"observed_at":"2026-08-07T15:31:46.779048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00573","last_updated":"2022-05-05T05:50:50Z","snapshot_observed_at":"2026-08-05T14:23:49.315145Z","submitted_at":"2021-08-02T00:33:27Z","title":"MuSiQue: Multihop Questions via Single-hop Question Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00573","snapshot_observed_at":"2026-08-07T15:31:44.114430Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.114430Z"},"links":{"cited_paper":"/paper/2108.00573","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:49759bfd7a31817b7492ff6b0ccdb8e0381145e9827852e4e2e63ae03ee903ff","observation_id":"2ef4bcdd-f7fc-43c1-bf0f-47719216ef2b","resolution":{"observed_at":"2026-08-07T15:31:44.114430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12766","last_updated":"2025-04-23T12:52:18Z","snapshot_observed_at":"2026-07-06T17:47:02.560132Z","submitted_at":"2024-03-18T17:32:32Z","title":"NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12766","snapshot_observed_at":"2026-08-07T15:31:44.178221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.178221Z"},"links":{"cited_paper":"/paper/2403.12766","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:84bef4bf106fd1cbdb6ec628d1f3ed570b28943871920008641ff14532bd6220","observation_id":"cbd023b7-282d-4cc8-8988-8356a1ee77bf","resolution":{"observed_at":"2026-08-07T15:31:44.178221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17419","last_updated":"2024-10-03T06:03:14Z","snapshot_observed_at":"2026-07-06T18:36:38.636181Z","submitted_at":"2024-06-25T09:42:56Z","title":"Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17419","snapshot_observed_at":"2026-08-07T15:31:44.194237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.194237Z"},"links":{"cited_paper":"/paper/2406.17419","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5bc55f4e84fad29033b5fc3127cc189b515645a9c58afc9e1b28a3a2ddaecd9f","observation_id":"4b1bcb33-ba5a-42d5-a058-b33a85c2f86c","resolution":{"observed_at":"2026-08-07T15:31:44.194237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06481","last_updated":"2018-06-11T17:08:20Z","snapshot_observed_at":"2026-07-06T06:04:45.729921Z","submitted_at":"2017-10-17T19:35:07Z","title":"Constructing Datasets for Multi-hop Reading Comprehension Across Documents","version":2},"cited_work":{"arxiv_id":"1710.06481","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.06481","snapshot_observed_at":"2026-08-07T15:31:45.503274Z","title":"Constructing Datasets for Multi-hop Reading Comprehension Across Documents","venue":"cs.CL","work_id":"e6103c6a-3757-4d4d-8b57-e4ad39e48f81","year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.246400Z"},"links":{"cited_paper":"/paper/1710.06481","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:3072fe7821eadb3aef5e4707550b8115e88fa8a7eb50d125f62e84116afe1db5","observation_id":"b9581f1e-2f10-4153-8766-480f809f0ba6","resolution":{"observed_at":"2026-08-07T15:31:45.621660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-07T15:31:44.312581Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.312581Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:b5b1aef7dbfcceeeded9cc5c3eaa70be4cd888024a01c46192ce71dd42822149","observation_id":"5ff3d9e1-8d88-46ad-9254-180582f74010","resolution":{"observed_at":"2026-08-07T15:31:44.312581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03025","last_updated":"2024-01-23T07:49:13Z","snapshot_observed_at":"2026-08-09T21:28:42.655685Z","submitted_at":"2023-10-04T17:59:41Z","title":"Retrieval meets Long Context Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03025","snapshot_observed_at":"2026-08-07T15:31:44.407153Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.407153Z"},"links":{"cited_paper":"/paper/2310.03025","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:b2ba2a5162fe24b6f5785cd027dd3a75f6f68d190322365a6cf1241ccbb799b7","observation_id":"56785ef9-37ba-433d-8bfc-7cc9266b1d39","resolution":{"observed_at":"2026-08-07T15:31:44.407153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T15:31:44.488966Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.488966Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f57d002c748af33bb7d901c6cf6718f6a1bc83b078839578528182e81c2231e9","observation_id":"a4e40009-68b7-40be-bbd4-977788e6046e","resolution":{"observed_at":"2026-08-07T15:31:44.488966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:44.581369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.581369Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:22b1bbdc6aeb88b078d649ba0de1d7c3df52f10c2d065e7d53040253bb856546","observation_id":"e8e23118-a6f0-417a-ba76-045f36f4d1ea","resolution":{"observed_at":"2026-08-07T15:31:44.581369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-08-10T08:40:49.847441Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-08-07T15:31:44.720004Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.720004Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:db666d1d9e54980a008d62975340f32e25c2523b455d7a9a06d40e6cffb9cd6b","observation_id":"6dd3275c-d11d-4ba1-a9c9-f1f20bed4d6c","resolution":{"observed_at":"2026-08-07T15:31:44.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09542","last_updated":"2024-06-26T04:48:11Z","snapshot_observed_at":"2026-07-06T17:02:30.471098Z","submitted_at":"2023-12-15T05:30:14Z","title":"Marathon: A Race Through the Realm of Long Context with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09542","snapshot_observed_at":"2026-08-07T15:31:44.836384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.836384Z"},"links":{"cited_paper":"/paper/2312.09542","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:29a599651135ed471487e7d1d14fc9fa17cbf170c70ace4d353841669f52b45a","observation_id":"72a004f4-ea60-4886-ac44-e919bf40462d","resolution":{"observed_at":"2026-08-07T15:31:44.836384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14116","last_updated":"2024-06-06T16:41:21Z","snapshot_observed_at":"2026-08-05T07:14:49.201751Z","submitted_at":"2024-02-21T20:30:45Z","title":"FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14116","snapshot_observed_at":"2026-08-07T15:31:44.948205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.948205Z"},"links":{"cited_paper":"/paper/2402.14116","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:cc982a4fb3264cf7ba9f77677b92a06de76f3f41521be65fb051277beb7f46ee","observation_id":"9019518f-0e40-4776-96d6-5b58b9a00648","resolution":{"observed_at":"2026-08-07T15:31:44.948205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:45.066367Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:45.066367Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:623052381558ee41f78fd5232e287a68864978055c537489b5b8922a3230e508","observation_id":"6401e0da-9b36-47da-ab4a-61d95f037865","resolution":{"observed_at":"2026-08-07T15:31:45.066367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:45.191937Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:45.191937Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:0fe406126b084e951d6803fe7bf5b1e6faf3b132ca7d58ec542814c0524cc721","observation_id":"5adbf85b-d3d8-4f0e-9ad2-0e3d1f172064","resolution":{"observed_at":"2026-08-07T15:31:45.191937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.02000."}