{"as_of":"2026-08-20T12:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4bd31f5d24a3601dc6302c24f281b2f85363e97405e3ec3f9dd145e3db7daa7","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:40:58.826285Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09328/citation-record","integrity":"/paper/2607.09328/integrity","json":"/paper/2607.09328/citation-record.json","paper":"/paper/2607.09328"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.826285Z","title":"Raw-source evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.826285Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:a425b6a7c31d11c4242216ed80fd3bcba2444e3795d10f01aa3dc8f69452e156","observation_id":"e4165941-492b-4e1c-b4a2-6a4d33f0e1ac","resolution":{"observed_at":"2026-08-02T07:40:58.826285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.860969Z","title":"URL https://arxiv.org/ abs/2606.19348","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.860969Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:83d9e85f20be97b1eb24f4d2c16b7545c95cff06384d0f55d494db836c726128","observation_id":"3a4b5c20-6e72-4afc-8839-fd879b986223","resolution":{"observed_at":"2026-08-02T07:40:55.860969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-18T17:58:16.707563Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-02T07:40:55.937791Z","title":"Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, and Jing Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.937791Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:9aaf9d9d5a33d52f153e67030f4f251f5565b5380acad6526db72a8ae8548fb6","observation_id":"4622702c-c9ff-45af-95ab-d7f71a5845ed","resolution":{"observed_at":"2026-08-02T07:40:55.937791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08888","last_updated":"2026-05-14T06:57:18Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:12:59Z","title":"DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08888","snapshot_observed_at":"2026-08-02T07:40:56.029050Z","title":"Tianyu Gao, Howard Yen, Jiatong Yu, and Danqi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.029050Z"},"links":{"cited_paper":"/paper/2605.08888","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:b145fc5969725e63473b3440495a5ae2097e4280181f7fa34d328d20dded02c3","observation_id":"197b182d-0c74-49dd-adfd-2f2f0e5128d3","resolution":{"observed_at":"2026-08-02T07:40:56.029050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T07:40:56.168353Z","title":"URLhttps://arxiv.org/abs/2503.19786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.168353Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:b760fb9ad64618d5f796daa888f22fa8eb4d045cf124d78f433243e1ece9e428","observation_id":"7ca26883-e3ce-42d8-9d41-76d8e40b4db9","resolution":{"observed_at":"2026-08-02T07:40:56.168353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24964","last_updated":"2026-04-27T20:05:41Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:05:41Z","title":"Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24964","snapshot_observed_at":"2026-08-02T07:40:56.445058Z","title":"Tomáš Koˇciský, Jonathan Schwarz, Phil Blunsom, Chris Dyer, Karl Moritz Hermann, Gábor Melis, and Edward Grefenstette","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.445058Z"},"links":{"cited_paper":"/paper/2604.24964","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:17ec5b9cb7d1a9eba00130760dabe056f87c5a6d2f1007ea12acbd5987ab1533","observation_id":"8af18281-6573-4540-b62e-5ed686f74739","resolution":{"observed_at":"2026-08-02T07:40:56.445058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:56.611667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.611667Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:5e89569da97b1a38261fbf5c168cd3ff6146f91b1a8218fdf26eb28ecc478fb4","observation_id":"4fa34d82-c498-4dd2-b4a5-5e6b5208bdea","resolution":{"observed_at":"2026-08-02T07:40:56.611667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:56.670841Z","title":"Nelson F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.670841Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:9921e12bb2a7321e4b59bb6c31a08f024db20fbcb71eeb959b62d2af6705a923","observation_id":"2f2da1a5-1f07-41fa-8233-ec0c4fa9635c","resolution":{"observed_at":"2026-08-02T07:40:56.670841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T07:40:56.900586Z","title":"Sewon Min, Eric Wallace, Sameer Singh, Matt Gardner, Hannaneh Hajishirzi, and Luke Zettlemoyer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.900586Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:3108133dbcd90e16cbf178f5f43e2f24ea7eebda3af8478a37095d43cc1da675","observation_id":"7260b785-016b-44bb-a2ff-a3db3dd3e8e7","resolution":{"observed_at":"2026-08-02T07:40:56.900586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-17T19:41:15.885170Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-02T07:40:57.024753Z","title":"press/v267/modarressi25a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.024753Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:03928d2c30417af8e0ca1eb59fb347fa623c3f5f5408222e1846d7ebf7a72e6b","observation_id":"0d42286d-b6b7-4820-98a6-6a6c136b73a7","resolution":{"observed_at":"2026-08-02T07:40:57.024753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-17T19:41:15.885170Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-02T07:40:57.166701Z","title":"URLhttps://arxiv.org/abs/2404.07143","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.166701Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:ae3fec9b8722c1c5eb2dcc09116cb23b16857179a34cffdb1a4e21ba7bec0140","observation_id":"d22003ee-8a96-45b7-926b-793b11998dfc","resolution":{"observed_at":"2026-08-02T07:40:57.166701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-02T07:40:57.554756Z","title":"11 Harsh Trivedi, Niranjan Balasubramanian, Tushar Khot, and Ashish Sabharwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.554756Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:6d62e9c6e6eb4a996c71125ff365ce7c16d13c8af47d2a59adc9d426c475b484","observation_id":"3296dad3-f356-467d-b8b3-19ec7a5bf16f","resolution":{"observed_at":"2026-08-02T07:40:57.554756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12766","last_updated":"2025-04-23T12:52:18Z","snapshot_observed_at":"2026-08-18T08:27:14.551488Z","submitted_at":"2024-03-18T17:32:32Z","title":"NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12766","snapshot_observed_at":"2026-08-02T07:40:57.650142Z","title":"Novelqa: Benchmarking question answering on documents exceeding 200k tokens.arXiv preprint arXiv:2403.12766, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.650142Z"},"links":{"cited_paper":"/paper/2403.12766","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:11d0563204c436946e724b971240723a4c9d88284c71865440caef2bd9ee8034","observation_id":"120ccf54-e084-4efd-8057-16fdb228a777","resolution":{"observed_at":"2026-08-02T07:40:57.650142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-19T14:42:43.739745Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-02T07:40:57.984751Z","title":"Biao Xiang, Soyeon Caren Han, and Yihao Ding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:57.984751Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:572544cdf1407456e349c8a83bfc0a0d4f9fb9685308947e0f46c253e251c0e8","observation_id":"9a7f0693-f639-49ef-8d61-87bfdc6691d9","resolution":{"observed_at":"2026-08-02T07:40:57.984751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.114779Z","title":"Kai Yan, Zhan Ling, Kang Liu, Yifan Yang, Ting-Han Fan, Lingfeng Shen, Zhengyin Du, and Jiecao Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.114779Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:2e71c728618a480814411597e5b2d551b3704f1f3678a354bdbd1dbe407387fa","observation_id":"fe763d1b-0d53-4554-bd91-4ce47b9a6495","resolution":{"observed_at":"2026-08-02T07:40:58.114779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-14T04:43:53.465410Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19293","snapshot_observed_at":"2026-08-02T07:40:58.250915Z","title":"100-longbench: Are de facto long-context benchmarks literally evaluating long-context ability?arXiv preprint arXiv:2505.19293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.250915Z"},"links":{"cited_paper":"/paper/2505.19293","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:179d8f03dc420bf5891ecbc0ac141825fd46291ef1905678b931094531e47d44","observation_id":"b118c4f5-32ae-4d1a-aa9d-fbb97ea9b043","resolution":{"observed_at":"2026-08-02T07:40:58.250915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-19T20:54:59.800056Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-02T07:40:58.349130Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.349130Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:231b2850fa56e8f9402abc8fcc2970324e1b8e26ff0c299b95868dc4bb2e4991","observation_id":"7b9d11d5-bfea-4a30-a41a-fdc19305862f","resolution":{"observed_at":"2026-08-02T07:40:58.349130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:58.484748Z","title":"Academiceval: Live long-context llm benchmark.arXiv preprint arXiv:2510.17725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.484748Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:02a2ae357ca31609ec8cca7db950ca94f3ab3d02784a18fc78dc3f2678a400d3","observation_id":"ef65d078-8b46-4f19-b04d-d11b6c463472","resolution":{"observed_at":"2026-08-02T07:40:58.484748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-18T21:14:34.716865Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-02T07:40:58.784842Z","title":"org/abs/2402.13718","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:58.784842Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:3354e265c731a3923ea27c14edd8c8e8888a44436ce8a02e97a1f65c1b41dcd8","observation_id":"b8133e90-1526-4ae2-bf84-6b0bf42b83dd","resolution":{"observed_at":"2026-08-02T07:40:58.784842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10149","last_updated":"2024-11-06T14:50:40Z","snapshot_observed_at":"2026-08-16T13:42:53.753710Z","submitted_at":"2024-06-14T16:00:29Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10149","snapshot_observed_at":"2026-08-02T07:40:56.540931Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack.arXiv preprint arXiv:2406.10149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.540931Z"},"links":{"cited_paper":"/paper/2406.10149","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:69515bd0496ecb46ff1d651dcb86eec62326fcb544f4e5b11cb8a44d05b441d7","observation_id":"5b0fcf00-ff01-4511-b418-633c4506c10f","resolution":{"observed_at":"2026-08-02T07:40:56.540931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-18T14:33:16.365411Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-02T07:40:56.244749Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.244749Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:59af5499c598c2a412de02c2c7ed6e545a17eef717b4663b40ec088a66dfad11","observation_id":"f9655137-add8-40a1-8f72-c849a75f5c15","resolution":{"observed_at":"2026-08-02T07:40:56.244749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.772989Z","title":"doi: 10.18653/v1/2021.naacl-main.365","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.772989Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:d4360e94e68295761224f9fbcc87fdd7f1e112c1430f29421545785935122f7d","observation_id":"b1c97332-b68b-4b22-9915-9ee9be2efefc","resolution":{"observed_at":"2026-08-02T07:40:55.772989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T07:40:56.105396Z","title":"Gemma Team","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:56.105396Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:78e0a5d6df7a4a4cc57e474df718eb6da814ca555a7b13fdb9e26a2b77178493","observation_id":"a7c6c680-f4cd-4972-a310-bef86399acc0","resolution":{"observed_at":"2026-08-02T07:40:56.105396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-02T07:40:55.337896Z","title":"doi: 10.18653/v1/2024.acl-long.776","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.337896Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:328e4258e392d901660099b14371d0a84ff5625bd11e04cd3b301c50900ed0a3","observation_id":"ceac9ee5-faf5-4ba3-9d24-290cb87df2b8","resolution":{"observed_at":"2026-08-02T07:40:55.337896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.418414Z","title":"acl-long.183","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.418414Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:936fe23dc2f2387558e0da7c6f991f8f1196b0828383468450e612c3f64320c7","observation_id":"61016f6d-48ac-4a0b-bd86-1562f88466a4","resolution":{"observed_at":"2026-08-02T07:40:55.418414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:40:55.620497Z","title":"Pradeep Dasigi, Kyle Lo, Iz Beltagy, Arman Cohan, Noah A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:40:55.620497Z"},"links":{"citing_paper":"/paper/2607.09328"},"observation_digest":"sha256:9a8f1f2883db0bfd744b54762adbeb17de32a2b9331953d1d72ed89bc9a2bf6d","observation_id":"f2e7e000-6061-4f37-8cfe-1dcaf8c8331e","resolution":{"observed_at":"2026-08-02T07:40:55.620497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09328","last_updated":"2026-07-23T17:56:03Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:40:29.786201Z","submitted_at":"2026-07-10T12:09:21Z","title":"WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.09328."}