{"as_of":"2026-08-19T17:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1f47fba1cdf43953998b9bef0926f6f5c9c0fbf5eb584373cbaf21f6c94906d","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:46:45.179215Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:31:24.303475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:27:56.511231Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":"2603.01152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-07-03T10:27:56.511231Z","title":"Deepresearch-9k: A challenging benchmark dataset of deep-research agent","venue":"cs.AI","work_id":"62b4fe1a-19ad-47fa-9046-89f23257ecdb","year":2026},"citing_paper":{"arxiv_id":"2604.17265","last_updated":"2026-05-12T13:20:03Z","snapshot_observed_at":"2026-08-15T20:03:58.672388Z","submitted_at":"2026-04-19T05:35:06Z","title":"MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T06:15:11.432788Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2604.17265"},"observation_digest":"sha256:2c00e167edde61af92881666e2b2407ebc0b71fa8be0a5474521421d25a41571","observation_id":"7d98f528-00f5-4c36-8abd-e32f7a39e76c","resolution":{"observed_at":"2026-06-23T03:12:46.256547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":"2603.01152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-07-03T10:27:56.511231Z","title":"Deepresearch-9k: A challenging benchmark dataset of deep-research agent","venue":"cs.AI","work_id":"62b4fe1a-19ad-47fa-9046-89f23257ecdb","year":2026},"citing_paper":{"arxiv_id":"2605.21965","last_updated":"2026-05-21T03:55:47Z","snapshot_observed_at":"2026-08-18T23:16:35.782881Z","submitted_at":"2026-05-21T03:55:47Z","title":"SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T06:50:06.933671Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2605.21965"},"observation_digest":"sha256:eb8da037d48f33ab40af6af1915b79c355c0bc1d30a59b755f0b58cf4c78d792","observation_id":"3e54a3a1-ad33-41c7-8a04-6163fae6ff69","resolution":{"observed_at":"2026-06-23T03:12:46.256547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":"2603.01152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-07-03T10:27:56.511231Z","title":"Deepresearch-9k: A challenging benchmark dataset of deep-research agent","venue":"cs.AI","work_id":"62b4fe1a-19ad-47fa-9046-89f23257ecdb","year":2026},"citing_paper":{"arxiv_id":"2606.12087","last_updated":"2026-06-10T13:49:11Z","snapshot_observed_at":"2026-08-02T15:03:50.335992Z","submitted_at":"2026-06-10T13:49:11Z","title":"FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T10:01:45.332920Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2606.12087"},"observation_digest":"sha256:f1eafd8500f19e2b8d66e38d0ac4a5c81884fe5199eb1d2020c2696dc75f88bd","observation_id":"99936593-f8fe-4c87-aed6-23bcfaebd5e5","resolution":{"observed_at":"2026-07-03T10:27:56.512551Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-08-01T15:02:37.058668Z","title":"Deepresearch-9k: A challenging benchmark dataset of deep-research agent.arXiv preprint arXiv:2603.01152, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28098","last_updated":"2026-07-29T05:08:21Z","snapshot_observed_at":"2026-08-17T06:41:49.597604Z","submitted_at":"2026-07-29T05:08:21Z","title":"SciDataSailor: Deep Scientific Data Exploring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:02:37.058668Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2607.28098"},"observation_digest":"sha256:50e4e82d9ec85f800eb706b2ea2b4d79a9ff3d40214312960a33e0185f1bdf06","observation_id":"7316b579-fadf-432c-993a-8c296e06f9a3","resolution":{"observed_at":"2026-08-01T15:02:37.058668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-08-04T13:31:24.303475Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.303475Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:e05fd0ceae7ae2856c8d8702d7548181cad0983e9384288e477ae44bfc01dc41","observation_id":"e84c7fd4-68bc-482a-9909-2e0e918727ec","resolution":{"observed_at":"2026-08-04T13:31:24.303475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.01152/citation-record","integrity":"/paper/2603.01152/integrity","json":"/paper/2603.01152/citation-record.json","paper":"/paper/2603.01152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.056202Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.056202Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:cc37f0941703d4d953a3085bc5342405b86e7f4abf2e903607740a7c668bbd01","observation_id":"47e9dc36-23cf-4350-a2ba-eb591cc4ea86","resolution":{"observed_at":"2026-08-02T19:46:36.056202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.264784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.264784Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7d3dd56ea99299f879b0b9cc88f6d7fc9a760e4cf713041ea90beabacb0970fd","observation_id":"80a19db1-52a9-40c4-bcc3-38ddb0f1f0c0","resolution":{"observed_at":"2026-08-02T19:46:36.264784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.390170Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.390170Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:d3bd45db69559ac56833135ffaae48a75a070508ae8616ded9e131aa7dd68d30","observation_id":"3297945f-d0b2-47c1-9c77-8e258456db4f","resolution":{"observed_at":"2026-08-02T19:46:36.390170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.547474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.547474Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:fbd3167c9b5c98d7027be7df2f006b864463dffbeb6cb9efc14c11b282744296","observation_id":"4f11f2fc-37c3-446f-b122-27214ce49a1a","resolution":{"observed_at":"2026-08-02T19:46:36.547474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.681856Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.681856Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:f30ebf9e7d9584951b6f70ce1c7df060047a53e4241321ef955562a87348bdc4","observation_id":"813ba9b5-bccb-4c27-bc6f-8ead17453430","resolution":{"observed_at":"2026-08-02T19:46:36.681856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.809506Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.809506Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:4957a5c211e82359db6931c91d2f633b610fc2c5bb423b28ae679034b329d264","observation_id":"3dc44489-6808-4722-8d84-a011fdcdad5a","resolution":{"observed_at":"2026-08-02T19:46:36.809506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06600","last_updated":"2025-08-08T17:55:11Z","snapshot_observed_at":"2026-08-16T19:56:18.562519Z","submitted_at":"2025-08-08T17:55:11Z","title":"BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06600","snapshot_observed_at":"2026-08-02T19:46:36.985526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.985526Z"},"links":{"cited_paper":"/paper/2508.06600","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:d80a4fab2e40da965b1cddae38789feefd7ae785840850dc558704e3f58eb7ee","observation_id":"4960c364-c247-4542-b649-0a74dd02ab3a","resolution":{"observed_at":"2026-08-02T19:46:36.985526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:37.150401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.150401Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:0c720a9fbed92088ace1917af7bc8cd1d531353fd31c426e786c837fd6e9b5b3","observation_id":"a3c1c305-3f1e-495c-ae83-50f4220ef2dd","resolution":{"observed_at":"2026-08-02T19:46:37.150401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T19:46:37.307887Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.307887Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7506a8331d6b5b1ac65c040b2532f37da552d6c86a679293ec4114e469229462","observation_id":"9f07014f-9e79-4513-a516-698b07620042","resolution":{"observed_at":"2026-08-02T19:46:37.307887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-18T17:58:16.707563Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-02T19:46:37.475191Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.475191Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:6f5d708f9d8c88f687b70d87ad278ec5a21896c75eb43bf00949976ec9c704f2","observation_id":"10b426c9-630f-461d-8675-2bebe77d74cb","resolution":{"observed_at":"2026-08-02T19:46:37.475191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:37.610798Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.610798Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:eab78622bc56c68d300f976e869415610d7cd9c2a7616746099bf9bb76e667ff","observation_id":"33dc1d2e-cf51-4084-90ec-76791cab9f59","resolution":{"observed_at":"2026-08-02T19:46:37.610798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10504","last_updated":"2026-07-12T05:28:34Z","snapshot_observed_at":"2026-08-18T12:33:12.856702Z","submitted_at":"2026-01-15T15:28:21Z","title":"DR-Arena: an Automated Evaluation Framework for Deep Research Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10504","snapshot_observed_at":"2026-08-02T19:46:37.784718Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.784718Z"},"links":{"cited_paper":"/paper/2601.10504","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:e87aa5e18cf20e9bbd5dd6edc57fc93f89d53d5e934f6e876662e3db88a2f749","observation_id":"8bf90c39-ffc7-4b80-8814-5b844ab97720","resolution":{"observed_at":"2026-08-02T19:46:37.784718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:37.961831Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:37.961831Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:b79675ef99f9370017eb7bb55fce42dc89f8efe901c6d050da45e541a34fe947","observation_id":"1aea910a-f0b2-4fbb-ad40-61aee70d5d6b","resolution":{"observed_at":"2026-08-02T19:46:37.961831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:38.074076Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.074076Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:52fc591850f5743989bda05c697f5976c62ee3a5614064102c1104bf982859c8","observation_id":"a4da654d-ad73-4c04-a5d7-f610268a9f8d","resolution":{"observed_at":"2026-08-02T19:46:38.074076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:38.240465Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.240465Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:62b5eed40765c203e203a8a38917b1c6c9e7f133945872451551fed25d8bec64","observation_id":"7a82a6fa-ad98-47a2-8b64-9418908a5cc8","resolution":{"observed_at":"2026-08-02T19:46:38.240465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:38.376216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.376216Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:b0d1f3d7c90d18988b3933eff453a3b88b3d78890eaca079cfd1a94fbbceba35","observation_id":"cbce755f-07ca-49b0-a44f-930db2fba3ab","resolution":{"observed_at":"2026-08-02T19:46:38.376216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T19:46:38.461831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.461831Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:530464f7318ceeaa3b948d06a8b3064c995be47c48c49a610cbff6b50a7ce08e","observation_id":"e126681a-8d32-4fc2-ab2a-c11c6f4e1f00","resolution":{"observed_at":"2026-08-02T19:46:38.461831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T19:46:38.547858Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.547858Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:51b2a602d00788d93ea2f0f615c4aff36a62f30f900af387d56d5e402b439171","observation_id":"ccecdd0d-125a-4631-a6ce-5cd4740c5371","resolution":{"observed_at":"2026-08-02T19:46:38.547858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:38.648298Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.648298Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:84fdff50d37a8f8ba741e274edc4a4b00e91a0f67df2ad5dd385bbeb4e88eef8","observation_id":"c69d740a-8abf-46b0-b39c-c860bba24388","resolution":{"observed_at":"2026-08-02T19:46:38.648298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-02T19:46:38.734248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.734248Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:46c770d9308f2e79271cfda0cd982e272053973ba6cad20216967a40936b8ef5","observation_id":"d59c7722-b03b-48a0-b7af-2245a51ec768","resolution":{"observed_at":"2026-08-02T19:46:38.734248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:38.890415Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.890415Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:26da7a8413d4f2decf861e9c93e157bf837a39e39ad4217f46f67c20397a4a12","observation_id":"c952bda9-4990-4e36-9a31-7513ea897b80","resolution":{"observed_at":"2026-08-02T19:46:38.890415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.014421Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.014421Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:ad06c70f6c9016e00a90121411129671ac42a79d587cada4bcd00d89af620b83","observation_id":"6fc26cbb-da25-49d5-98b4-cf9163f6958f","resolution":{"observed_at":"2026-08-02T19:46:39.014421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.130399Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.130399Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:caf33507354cf66b1045b4e76bd0fbfbe0917558c6f1f635569c51db35a51dbd","observation_id":"96ddb04e-0bf2-47b5-95ac-3e06ca604db2","resolution":{"observed_at":"2026-08-02T19:46:39.130399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.256277Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.256277Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:b19d4baf4727654287784c87e2c2bfafbef4a2e41949ac27ded37bb2c2ebb517","observation_id":"aa529ef4-2660-4717-9c6f-1c6835f7834f","resolution":{"observed_at":"2026-08-02T19:46:39.256277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.386425Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.386425Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:9f9e9ffe9e240770219f5e34af30c84319d6fdc0b20899c91eaf2a874770728e","observation_id":"39ae2ef2-9b3e-4bc1-863d-8250ec475dc4","resolution":{"observed_at":"2026-08-02T19:46:39.386425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.554440Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.554440Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:5f71a568d93ba134cfd1bba5729327955c61800675bbae9f82f9fa9668ee7976","observation_id":"c93db0da-2e08-4feb-9c4f-82d8797132c4","resolution":{"observed_at":"2026-08-02T19:46:39.554440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.667948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.667948Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7dcc87b2bc0b3e1147078f1bd489efb8427b9c5c7701eda6c9610a61ce90cb38","observation_id":"af41fcfa-bb69-4fea-b1d8-ac4cc1f39f1f","resolution":{"observed_at":"2026-08-02T19:46:39.667948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:39.785839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.785839Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7b5ae4f306154b28d7425f6672999c893f80cda7d2d52691e1a2d83b985746fa","observation_id":"9730cfca-09d8-439a-bc87-3460fdda7ef3","resolution":{"observed_at":"2026-08-02T19:46:39.785839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-02T19:46:39.940241Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:39.940241Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:ba37b5514fcc94687483d5b7092e82a1f0cdc8a6938e23ca8bb7540cb5be0ea6","observation_id":"340d4b9f-926c-42a5-bdab-7b28a47c9e56","resolution":{"observed_at":"2026-08-02T19:46:39.940241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:40.107847Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.107847Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:e04a146879764795e0885cc57e175a5a4e75d89fb77de33b5c471505105bed19","observation_id":"871b0b53-c439-4836-9c53-6d3cc4a184e2","resolution":{"observed_at":"2026-08-02T19:46:40.107847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:40.172725Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.172725Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:8db180eac9413ad3d9e2f1e5fcc232c476a7d8f8e776885ab7dcac4a99c99430","observation_id":"9db9e177-1246-49cf-be9b-c11220de2768","resolution":{"observed_at":"2026-08-02T19:46:40.172725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T19:46:40.178894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.178894Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:31040f00df35416faf902e6d4130bfced2a74c64a272baed23140e2f4b370127","observation_id":"248a9c5a-b85a-4d20-908d-f341b6649ea1","resolution":{"observed_at":"2026-08-02T19:46:40.178894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-17T01:58:07.850738Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-02T19:46:40.280720Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.280720Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:f6e511d2f95867ea641616b707a76297f184371abef47ccb512c7a5cce98ba41","observation_id":"33a08749-7934-4b46-b528-c8289ccfa1d2","resolution":{"observed_at":"2026-08-02T19:46:40.280720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:40.446778Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.446778Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:89fbf09ca4792078d7a44a5c16d1bd7b63d854ee576c443c68155dfaed011a2a","observation_id":"3f6e35e2-b34f-47d6-8382-7db5c1905292","resolution":{"observed_at":"2026-08-02T19:46:40.446778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-02T19:46:40.693646Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.693646Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:057472f88d597db1587a1ce9ef827b2fa5fb48fe757287390dec37283f51466c","observation_id":"db980910-35c8-4186-ba72-6a240f292686","resolution":{"observed_at":"2026-08-02T19:46:40.693646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05960","last_updated":"2023-08-11T06:37:54Z","snapshot_observed_at":"2026-08-17T04:59:29.423407Z","submitted_at":"2023-08-11T06:37:54Z","title":"BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05960","snapshot_observed_at":"2026-08-02T19:46:40.814191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.814191Z"},"links":{"cited_paper":"/paper/2308.05960","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:e26381831be72aa0bee6f1a9085d51314467b1d3e31108defc016c6724e5d295","observation_id":"388fdae6-b527-463c-ae60-00610c7b0d83","resolution":{"observed_at":"2026-08-02T19:46:40.814191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:40.922664Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.922664Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:6e05eb63c7cdcf9d9e89b130f7352a9bf380346955677d61f1bfd03ee2f71fa2","observation_id":"430068e1-d579-4802-8706-d66635094b2d","resolution":{"observed_at":"2026-08-02T19:46:40.922664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02916","last_updated":"2019-06-30T22:30:19Z","snapshot_observed_at":"2026-08-15T04:31:33.137248Z","submitted_at":"2019-06-07T06:22:17Z","title":"Multi-hop Reading Comprehension through Question Decomposition and Rescoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02916","snapshot_observed_at":"2026-08-02T19:46:41.018930Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.018930Z"},"links":{"cited_paper":"/paper/1906.02916","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:5bfa1e66e011b484723c47ca8b513672c8000675e8dbedf6ea8b1f567ec690bd","observation_id":"f8fd960b-9593-4c2b-b646-e98ccc7bdfb0","resolution":{"observed_at":"2026-08-02T19:46:41.018930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.105225Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.105225Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:647f22e7411c9853f9634cee778895551d8f363ab6f8be68f4c316348ba1c440","observation_id":"f26f8ccc-89ab-4a3c-a48d-d7c4db193f56","resolution":{"observed_at":"2026-08-02T19:46:41.105225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-02T19:46:41.256849Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.256849Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7deed828dbc679932ff46266652851f5671178ec856bcc5d8807a427f7ca9391","observation_id":"2cbea9c6-03be-4beb-b4d6-cc1e4b085cf0","resolution":{"observed_at":"2026-08-02T19:46:41.256849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.344453Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.344453Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:4b31dc015e3a64112491fe6d6e726f75d3a8eedd7f0c498774f2b1f6bfaebd82","observation_id":"f3f271ab-d2ac-4aae-9b8c-2dea2bd704cf","resolution":{"observed_at":"2026-08-02T19:46:41.344453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-02T19:46:41.429321Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.429321Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:0bf4c81e2e822e4ba78f532b96d0c11e5ef7e183266151ebf5dbca8cb2113ee2","observation_id":"9a37c819-12ac-46bf-8d1e-4d0f9e66a32a","resolution":{"observed_at":"2026-08-02T19:46:41.429321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07000","last_updated":"2019-10-15T18:44:47Z","snapshot_observed_at":"2026-08-18T20:14:28.176934Z","submitted_at":"2019-10-15T18:44:47Z","title":"Answering Complex Open-domain Questions Through Iterative Query Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07000","snapshot_observed_at":"2026-08-02T19:46:41.514302Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.514302Z"},"links":{"cited_paper":"/paper/1910.07000","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:c67bc3d4498b40c5ca156ac664c7acfaf262444e38149d5dfee0bb740d36a202","observation_id":"5de849f5-364d-40f1-a26a-0ca3e6c122dc","resolution":{"observed_at":"2026-08-02T19:46:41.514302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.599213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.599213Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:0266c93cd5fbf575e10e2de4be99a94370d55b35d9fa1d592887c66940bc9483","observation_id":"46211042-698b-4f5a-b376-598049e1d4a1","resolution":{"observed_at":"2026-08-02T19:46:41.599213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.697929Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.697929Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:5f0da770f855191081f2e6e5e2fec1f89a6d943952d02735323552eddc0663d1","observation_id":"e9aed41f-1f31-408b-b7d1-c73ffc37b8e3","resolution":{"observed_at":"2026-08-02T19:46:41.697929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-02T19:46:41.757885Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.757885Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:82562cfd51daee70bd4110a3e2c0d53e7de6aa0cdb80790f04fe05e31ee97242","observation_id":"4ced405d-3d45-4977-aff5-f6fa05c79613","resolution":{"observed_at":"2026-08-02T19:46:41.757885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.835899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.835899Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7af4e1ef7026f509d75775c6109671a9e9be3a974e82ce69590211884b023042","observation_id":"1c76e1a7-3b37-4981-8107-44b1aca2ed47","resolution":{"observed_at":"2026-08-02T19:46:41.835899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:41.955351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.955351Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:8ad3df6bee9543752885c057e2470c25596bbdb0fdff0ef3271fe086c730746c","observation_id":"024791d7-997c-463a-b70d-35bd3f3838a6","resolution":{"observed_at":"2026-08-02T19:46:41.955351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T19:46:42.270579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.270579Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:ba1b3e8ce257587fe7654a7b440db1b040900f018ab7def7c6c180d769212d84","observation_id":"be8de349-57e1-4fde-b7a0-5b807f2be1fb","resolution":{"observed_at":"2026-08-02T19:46:42.270579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:42.364309Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.364309Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7e17da097a951912dfb38dd8f969bc77e3842e617e3a963d46a9e50cc5f64c3e","observation_id":"9b842d84-b5c3-41ae-82ee-0b63e91fdce9","resolution":{"observed_at":"2026-08-02T19:46:42.364309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:42.467286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.467286Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:b1680a8c9c97e0cf47d8f5b74ac658108d0b4ff1164fedf49f6575f5b879eeff","observation_id":"14e550b2-b66f-4afd-92fe-1265e4c8186e","resolution":{"observed_at":"2026-08-02T19:46:42.467286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:42.671546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.671546Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:174a5c9f064401951bf0b41c43c4f7ae284767d675249e7f324bb8f59adecdb5","observation_id":"194e607f-1bfa-435e-b640-fa6f2d2e077d","resolution":{"observed_at":"2026-08-02T19:46:42.671546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-02T19:46:42.737492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.737492Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:e3b4fc0365b13312b4124b9a95bdfed58bbed99a82c7050ed4be155d28bfab75","observation_id":"8e4d0d81-42c9-43eb-b59f-972485bfa129","resolution":{"observed_at":"2026-08-02T19:46:42.737492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08663","last_updated":"2021-10-21T01:18:28Z","snapshot_observed_at":"2026-08-09T23:22:21.200279Z","submitted_at":"2021-04-17T23:29:55Z","title":"BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08663","snapshot_observed_at":"2026-08-02T19:46:42.816248Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.816248Z"},"links":{"cited_paper":"/paper/2104.08663","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:a4d5e72768d5cbc010dee296c13576d955c84576be7d9f02d10f0451d8ae4829","observation_id":"cb218cc8-5bcb-41a2-b821-2924ff8349f6","resolution":{"observed_at":"2026-08-02T19:46:42.816248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:42.943706Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.943706Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:044675ec07386aca2b8fb4b15ca9c9a6844006d81a15340e80f245494c0cdde5","observation_id":"4455723c-abec-4331-b85c-a11ed65bcc32","resolution":{"observed_at":"2026-08-02T19:46:42.943706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14283","last_updated":"2024-07-22T10:01:49Z","snapshot_observed_at":"2026-08-16T13:41:07.256700Z","submitted_at":"2024-06-20T13:08:09Z","title":"Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14283","snapshot_observed_at":"2026-08-02T19:46:43.187057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.187057Z"},"links":{"cited_paper":"/paper/2406.14283","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:71e228e9c3ac71d0e89028cf5f2eb993605932a7d0fd1f65e020fa9432904dcc","observation_id":"ec8c5023-e6f9-4d50-ba88-74a9af2fd8d5","resolution":{"observed_at":"2026-08-02T19:46:43.187057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:43.296106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.296106Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:5cba6187fd69ed73910ddc9dff4207ab3a19daba065078804d46cc67d5274b7a","observation_id":"72154966-bbc2-4ab0-8c5e-e75ee3ffd7ac","resolution":{"observed_at":"2026-08-02T19:46:43.296106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:43.393593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.393593Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:528aaffc4e2e2d266c32b0d1baf0d906a6285a3de0edb6056234a2d17b70b5ef","observation_id":"8985199e-0734-4f7b-8760-92c7a056981a","resolution":{"observed_at":"2026-08-02T19:46:43.393593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:43.747753Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.747753Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:042b4a411f01bc6074d2840e2ce1e9d483c75874ea5669d99cf0ebc57410690b","observation_id":"b13dee8c-ceb8-49f4-a79c-a5aa64260c06","resolution":{"observed_at":"2026-08-02T19:46:43.747753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:43.902448Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.902448Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:c1d05f0932ba15fd34299257d43b15e7f2e890e679cb9aff3c9abc48dc874423","observation_id":"cbae67e1-00cb-44b5-bc47-777a4f6758ab","resolution":{"observed_at":"2026-08-02T19:46:43.902448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:43.085349Z","title":"Transactions of the Association for Computational Linguistics10 (2022), 539–554","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.085349Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:38e2145e9c9f2daf74e00e5e8ce4a068696bc9cbb0d616ce5a6761dfdf568aa5","observation_id":"da714e4f-84ba-468d-8c2c-8a1d9fd0eea3","resolution":{"observed_at":"2026-08-02T19:46:43.085349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12756","last_updated":"2021-02-19T22:15:03Z","snapshot_observed_at":"2026-08-17T21:54:41.083823Z","submitted_at":"2020-09-27T06:12:29Z","title":"Answering Complex Open-Domain Questions with Multi-Hop Dense Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12756","snapshot_observed_at":"2026-08-02T19:46:44.108789Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.108789Z"},"links":{"cited_paper":"/paper/2009.12756","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:7cf9fdf996c7735e87e3721659115506fecc94817710867ce8aa2f312061c37a","observation_id":"0ab0762c-ce21-45d4-87ef-212e6a27a951","resolution":{"observed_at":"2026-08-02T19:46:44.108789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-16T02:27:50.910548Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12594","snapshot_observed_at":"2026-08-02T19:46:44.219868Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.219868Z"},"links":{"cited_paper":"/paper/2506.12594","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:16de6c76f8a5e54e8308bbfcfa1392545e9df052e3d79e0c1bf1f2bd3e0d987f","observation_id":"1033bced-947c-47a6-bf01-8701ad8d9315","resolution":{"observed_at":"2026-08-02T19:46:44.219868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-02T19:46:44.386944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.386944Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:60dfb08bc658c9089175875534c36f31e1ea6e0c0fb297f7d0690219254f7043","observation_id":"10e73ecf-2106-417e-9df5-69b207794805","resolution":{"observed_at":"2026-08-02T19:46:44.386944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-19T14:42:43.739745Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-02T19:46:43.536223Z","title":"arXiv preprint arXiv:2504.12516(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:43.536223Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:62c7c382c2579b3f8ca19f629f540598837bd02a703fb3a7450d786a615b880b","observation_id":"226996e0-590f-4bf1-9419-74cc107b499c","resolution":{"observed_at":"2026-08-02T19:46:43.536223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:44.638140Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.638140Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:612c778829ba0bed585f6636efc452deaf768ca70690d7bfe3e5002cd158f941","observation_id":"79ab8a80-1c1a-416d-84ed-d494b9932b51","resolution":{"observed_at":"2026-08-02T19:46:44.638140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-02T19:46:44.793381Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.793381Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:6eeb29bef4f5688dc38aa6e3d8c423d44dcb454d8caa065baa786e4a9b89cc92","observation_id":"397e59d0-32dd-430e-9110-8914bce5e543","resolution":{"observed_at":"2026-08-02T19:46:44.793381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:44.020730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.020730Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:57437df6c7dc5ad6c36aaa6f6df0df6655d4ec7a1bb182862cde4678fe1ae9b4","observation_id":"b0d79acf-217c-4b27-b4cb-8f5a559336fc","resolution":{"observed_at":"2026-08-02T19:46:44.020730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:45.179215Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:45.179215Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:81ecdfc146b5ed50b0bf78fcd34cf2254e344ff82ed0f156728f5614a02264c3","observation_id":"879ba7a4-da55-45d6-bc44-375fdeb568ef","resolution":{"observed_at":"2026-08-02T19:46:45.179215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:44.486904Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.486904Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:26ec67fa9516cd74a5af306d148ef6c27b0f384c555de2b2bf2c0518f611f0f5","observation_id":"61f8f9d4-919b-4596-b8f9-348f88ed5826","resolution":{"observed_at":"2026-08-02T19:46:44.486904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:44.913515Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:44.913515Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:0f24a061335d46ccddbd6ce43454e9a5dc5c60d67bfe893cf1e0aeb8b32da82c","observation_id":"593453fc-e6a8-49c2-8bc8-81c0ecfecde9","resolution":{"observed_at":"2026-08-02T19:46:44.913515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T19:46:42.101108Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.101108Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:68f5cd39a426828f30fd88f6d23461bc15aef2e0f5918be6ce5e4fbf4790e20f","observation_id":"71bda43f-0691-43c4-b9a2-8001e3bd0924","resolution":{"observed_at":"2026-08-02T19:46:42.101108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-18T19:00:40.885312Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-02T19:46:40.534368Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:40.534368Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:fe813acd084e0ea9541f648606b33008d78eabaaee096a01232d7125f32718a8","observation_id":"a882b5d5-f23b-4971-8a56-0c857da2e806","resolution":{"observed_at":"2026-08-02T19:46:40.534368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17517","last_updated":"2023-03-08T16:47:46Z","snapshot_observed_at":"2026-08-16T16:19:42.294096Z","submitted_at":"2022-10-31T17:41:26Z","title":"Lila: A Unified Benchmark for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17517","snapshot_observed_at":"2026-08-02T19:46:41.170740Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:41.170740Z"},"links":{"cited_paper":"/paper/2210.17517","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:615c85de0f01d3d8997ed67b9454d9611776ac410ed4a40b32d945e5fab142d8","observation_id":"fa47cefa-cb68-4bee-b481-878d613f174a","resolution":{"observed_at":"2026-08-02T19:46:41.170740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:46:36.140715Z","title":"InProceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:36.140715Z"},"links":{"citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:0c62f41a8e5f38ac466fe9c306df8b53cb252dc15d6b5354c6ae3ee7e49334aa","observation_id":"abb0b937-b17d-4f67-9eab-1623a1745b23","resolution":{"observed_at":"2026-08-02T19:46:36.140715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14924","last_updated":"2024-09-23T11:20:20Z","snapshot_observed_at":"2026-08-16T13:16:18.351948Z","submitted_at":"2024-09-23T11:20:20Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14924","snapshot_observed_at":"2026-08-02T19:46:45.069746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:45.069746Z"},"links":{"cited_paper":"/paper/2409.14924","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:89261c82e40a24ee8de87321415e8eb17017a3d35eab974a5069086c8e4d8cb1","observation_id":"3b201037-1f8b-437f-995d-4af0f1553901","resolution":{"observed_at":"2026-08-02T19:46:45.069746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T19:46:42.554524Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:42.554524Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:457fe526548bf2cd59ff26d78e8ccacacc92ce8eecf92b92d9717cdb0013c719","observation_id":"94a22af8-29db-44d8-a2a3-916a7ba903db","resolution":{"observed_at":"2026-08-02T19:46:42.554524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 5 inbound Pith citation observations for arXiv:2603.01152."}