Pith. sign in

Paper Citation Record · LEDGER

Deep Research Bench: Evaluating AI Web Research Agents

As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2506.06287.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.06287 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:43:23.463534Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T04:50:21.684667Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation bec7f51e-b3bc-4c3f-957b-2dffb5b8ca45 · inbound

Bench to the Future: A Pastcasting Benchmark for Forecasting Agents cites this paper.

Bench to the Future: A Pastcasting Benchmark for Forecasting Agents Deep Research Bench: Evaluating AI Web Research Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T04:43:23.463534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:43:23.463534Z digest=sha256:df34fae9ee988d5b8ae4a0166c414fa880994daaf6dbd992c412b8767d7838c2

Observation e760e549-c48e-4a8e-802d-09ddafef1def · inbound

A Survey of Context Engineering for Large Language Models cites this paper.

A Survey of Context Engineering for Large Language Models Deep Research Bench: Evaluating AI Web Research Agents

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-13T20:58:45.494330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-13T20:58:45.060041Z digest=sha256:e68e602305442eb2283b5253e38cb5c62cc457d1da8fd877326bba30d88781c1

Observation a7be4d39-beda-43fd-811e-3deddc64d4a5 · inbound

Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts cites this paper.

Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts Deep Research Bench: Evaluating AI Web Research Agents

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T14:22:31.357022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T14:22:31.357022Z digest=sha256:64269b5df3c2099df81bbe01e13526d938fb40ac4e0c450319d2aee74a34b3af

Observation 9eb6e252-b576-4a9b-83d2-4dc6fe297981 · inbound

Characterizing Deep Research: A Benchmark and Formal Definition cites this paper.

Characterizing Deep Research: A Benchmark and Formal Definition Deep Research Bench: Evaluating AI Web Research Agents

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T00:56:03.602916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:56:03.602916Z digest=sha256:3190ec081088f154569bbbc8de5dc6af9b0e48c0e23109b6159e8e1982a89e33

Observation 8587929c-a81f-45af-a2bb-4ff14eaefd61 · inbound

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence cites this paper.

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence Deep Research Bench: Evaluating AI Web Research Agents

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T12:11:33.637116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:11:33.637116Z digest=sha256:181f9afdb2e7cd12a7126fc068cdb45e85fa1826183318224b58308fd4efc658

Observation 04233726-81f8-4367-827f-3c8e2afee05d · inbound

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services cites this paper.

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services Deep Research Bench: Evaluating AI Web Research Agents

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T18:00:22.112227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:00:22.112227Z digest=sha256:c4cd251589e5fc88020442a48bd18ab66294869bcf729b43ce9e451a7adbd78c

Observation 3a52d6b8-ca8f-4289-a004-aa48765ec161 · inbound

SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning cites this paper.

SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning Deep Research Bench: Evaluating AI Web Research Agents

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-11T17:01:08.394021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-09T14:18:14.048230Z digest=sha256:288e525bc00455d3ba5124dc063e5690f20dddd0eee521e761cc78288ae1d508

Observation d674251d-08dc-453e-9ccb-4fc6b1ba57ec · inbound

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics cites this paper.

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics Deep Research Bench: Evaluating AI Web Research Agents

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T02:11:16.030282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T02:07:39.648269Z digest=sha256:32c42ab14bcbb743445f172d0a0a3f6fe89744c20b9157f103fb5e05a058dcee

Observation 0caa09fe-b545-48a3-9d4b-96c4ce779b96 · inbound

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? cites this paper.

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? Deep Research Bench: Evaluating AI Web Research Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.859311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-20T10:15:37.280308Z digest=sha256:fc6ac4f7adffc6a321e45ddcfee7f36f8121a8a0fb78d6ddffec3a17fca28791

Observation 2c2ea197-9afb-4156-b804-ff08992244ed · inbound

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery cites this paper.

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery Deep Research Bench: Evaluating AI Web Research Agents

Reference 128

Resolution
verified exact
arxiv_id, observed 2026-05-25T04:50:21.689384Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-25T04:46:43.679185Z digest=sha256:aa4222b7fac58d1891dc8e3a4f8376bf8e6a2a12831320a6ea296bd1e6922ee1

Observation 9cb59fbd-a252-4bc5-8930-1e6e3d80865a · inbound

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting cites this paper.

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting Deep Research Bench: Evaluating AI Web Research Agents

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T16:11:33.698186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T16:11:33.698186Z digest=sha256:8c0a403439ca6285a53f3661538afe961e71459af73123ba05da99a4d7cf01c6

Observation c8835e40-bd78-4d43-9c99-e4e885aecb1c · inbound

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports cites this paper.

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports Deep Research Bench: Evaluating AI Web Research Agents

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T09:12:23.215495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T09:12:23.215495Z digest=sha256:efd9c75eec0fbe0c3af0ca5293f67691d6867ecdad4ab7938c5810a591f4e15e