Pith. sign in

Paper Citation Record · LEDGER

DABstep: Data Agent Benchmark for Multi-step Reasoning

As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 21 inbound Pith citation observations for arXiv:2506.23719.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.23719 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:37:54.197640Z

measured 72 of 72 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 21 of 21 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T04:39:03.430946Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact0
  • verified fuzzy35
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 4d315fcc-0848-49ac-96e1-6050c8eafbb1 · outbound

This paper cites Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.

DABstep: Data Agent Benchmark for Multi-step Reasoning Llama 3.2: Revolutionizing edge ai and vision with open, customizable models

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.279909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.333473Z digest=sha256:96f1e5916da547dc7006271ea92f7db573b0c31ed3615ce45f927789c2012e3e

Observation 9c41d26e-68ac-488d-8c30-1c7a2a243d09 · outbound

This paper cites The llama 4 herd: The beginning of a new era of natively multimodal ai innovation.

DABstep: Data Agent Benchmark for Multi-step Reasoning The llama 4 herd: The beginning of a new era of natively multimodal ai innovation

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.267190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.377890Z digest=sha256:2d62164ded6fbaf497c2e807282a06e2e0bc7448279dc1aaaec48a7f84cb039f

Observation 53a705c0-6657-455f-819c-9013f35389f5 · outbound

This paper cites Claude 3.5: Next-generation language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning Claude 3.5: Next-generation language models

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.254588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.463981Z digest=sha256:0eefd31c4e49f7b1d0de5a5ed01c80cfd9877cf4e91f5e10016616a034415ce7

Observation c216f380-c155-4219-a7c5-bb70cd4309b3 · outbound

This paper cites Claude 3.7: Advancements in language understanding.

DABstep: Data Agent Benchmark for Multi-step Reasoning Claude 3.7: Advancements in language understanding

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.241879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.507926Z digest=sha256:9ad76633845778468077de6b9f312d7c73120e7ccaeea9596f0432cdebbd3727

Observation 13d8d062-c7cf-449e-bfc8-21c54f844013 · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:57.228911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.590499Z digest=sha256:1f13c6e43d56ad46ac931ace5db00ffe078afc1d826ea293ef11d55a659ea567

Observation dbeba95d-0dd7-46bf-9482-91eef5049960 · outbound

This paper cites MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering.

DABstep: Data Agent Benchmark for Multi-step Reasoning MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.650169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.650169Z digest=sha256:03a331a0e288fb5a93b643e8a4c9982c8842b5e758c1f34270e3c9def5e2ed15

Observation 5c594346-2d69-4e4f-a8d5-abcdcee3746b · outbound

This paper cites Evaluating Large Language Models Trained on Code.

DABstep: Data Agent Benchmark for Multi-step Reasoning Evaluating Large Language Models Trained on Code

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.711814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.711814Z digest=sha256:066bd5b4084ad43f285419b8bd9e5b2f0d884130ea81fbf49c808561bb8cf6e8

Observation 39c164cf-b273-49ef-92df-ad7218e1e9ff · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

DABstep: Data Agent Benchmark for Multi-step Reasoning Training Verifiers to Solve Math Word Problems

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.787132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.787132Z digest=sha256:caab7daa90f346f9ee4c60498e2c25110b59175156db42582969d0307ee691f1

Observation be278e08-16aa-4dc6-8875-c0a78999081d · outbound

This paper cites Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste.

DABstep: Data Agent Benchmark for Multi-step Reasoning Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.215894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.852268Z digest=sha256:b097be52fff25371ee41b131cefe8faf56336dd36305909e152c319059089603

Observation 25d5083f-57c2-4d75-8493-b73cee719fda · outbound

This paper cites Gemini 2.5: Our most intelligent ai model, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gemini 2.5: Our most intelligent ai model, 2025

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.202284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:50.943251Z digest=sha256:a3e21052fa97d2b40b60de050f4be5a646d89baf93a6d6e9ac57d0d3bbebbf78

Observation f42eff18-f0fa-41d3-80dc-ac02d16b4a38 · outbound

This paper cites The Llama 3 Herd of Models.

DABstep: Data Agent Benchmark for Multi-step Reasoning The Llama 3 Herd of Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.993213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.993213Z digest=sha256:b020dd70e0aad32d302d456431b9b1486a5393436cfc0ed3dcbdf6bd1675744b

Observation 6923dfeb-86cc-480d-8a21-377f4f3458b5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

DABstep: Data Agent Benchmark for Multi-step Reasoning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.085757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.085757Z digest=sha256:b6d2f528d9c6160b2907f8f65c4b6855f46adf7ad16582b096ee91650f100b42

Observation efd09a51-46ec-42ea-b264-43336721becc · outbound

This paper cites Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data.

DABstep: Data Agent Benchmark for Multi-step Reasoning Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.186096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.166759Z digest=sha256:f6b17550af4e75c3b33c3fd76cdcb720324c6cacefdf6c72d480fdbf1d95a539

Observation d60b1519-3c14-4765-a5db-57d57519602f · outbound

This paper cites Measuring mathematical problem solving with the MATH dataset.

DABstep: Data Agent Benchmark for Multi-step Reasoning Measuring mathematical problem solving with the MATH dataset

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.172170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.238203Z digest=sha256:2d10173366c1141082b7d5b7a4e89950bf71c2e38b68d0054b7d56369a751c06

Observation 3e367110-4d52-4d25-adb3-e8549ba96535 · outbound

This paper cites InfiAgent-DABench: Evaluating agents on data analysis tasks.

DABstep: Data Agent Benchmark for Multi-step Reasoning InfiAgent-DABench: Evaluating agents on data analysis tasks

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.158449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.368894Z digest=sha256:b21e3c820a7904d8ffdd0e9884ebb1c46e2f824f8e67c875b4c89e0e65f94eac

Observation 1977c770-4d5b-46ae-a20c-82fba8066dfc · outbound

This paper cites Mlagentbench: evaluating language agents on machine learning experimentation.

DABstep: Data Agent Benchmark for Multi-step Reasoning Mlagentbench: evaluating language agents on machine learning experimentation

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.144688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.414910Z digest=sha256:ce81dc29818ad9656bd7065b6d2049ddb09dd0bbb725ae97be8af92f4b1bbe0c

Observation 87af90cf-60bb-4edd-87e6-13c81dee47b3 · outbound

This paper cites DA-code: Agent data science code generation benchmark for large language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning DA-code: Agent data science code generation benchmark for large language models

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.125954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.518323Z digest=sha256:a2a4da1db10b815bfb8989c6f6b3d83f61b5bc34100e750edc0553e76d76f23e

Observation e6b73b48-8231-49a3-9207-fffff11dea19 · outbound

This paper cites Financebench: A new benchmark for financial question answering, 2023.

DABstep: Data Agent Benchmark for Multi-step Reasoning Financebench: A new benchmark for financial question answering, 2023

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.577389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.577389Z digest=sha256:08e225a975d8b9b7f057f9cd3cc3fe423fa18125168f269c27a181c39c91dfbf

Observation 1ffd4f8f-cb5e-426f-814c-8932093f66a5 · outbound

This paper cites SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024.

DABstep: Data Agent Benchmark for Multi-step Reasoning SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.695010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.695010Z digest=sha256:9cf622a69a830b0d5b3f0ed852348ce1d5b333d39a31d71ba542de990dc1744f

Observation dad541e7-06b3-471f-85c6-5da7590a891b · outbound

This paper cites DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.093190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.782173Z digest=sha256:50403579d09ad9b7d0be8f5d96acefffe024930d5c668a372b5efa8536807fc6

Observation a3da2933-c194-4152-9803-8d353273e5cd · outbound

This paper cites Ds-1000: A natural and reliable benchmark for data science code generation.

DABstep: Data Agent Benchmark for Multi-step Reasoning Ds-1000: A natural and reliable benchmark for data science code generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.897687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.897687Z digest=sha256:d516baf85eb1a4e99317e6171eab55432c8ac3b5e277fc9b8dea8c1ddb3747b7

Observation ccad99ba-4c64-4542-9986-c7e4cd043976 · outbound

This paper cites KaggleDBQA: Realistic eval- uation of text-to-SQL parsers.

DABstep: Data Agent Benchmark for Multi-step Reasoning KaggleDBQA: Realistic eval- uation of text-to-SQL parsers

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.069791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:51.960292Z digest=sha256:effa1934e3b68c658ab47cc2f595bca323badbfc700040d6593699416ffa64ad

Observation ad14efe0-2847-4d41-90b9-c4c0929c0bac · outbound

This paper cites Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows.

DABstep: Data Agent Benchmark for Multi-step Reasoning Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.056301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.035704Z digest=sha256:a8f6c0d338a726944e83ad1493e163d59b1f123d856a1c3aadc23236adb4a0b1

Observation f69aea46-4d3c-4d41-ad35-33788897ee2f · outbound

This paper cites Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls.

DABstep: Data Agent Benchmark for Multi-step Reasoning Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.042324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.115929Z digest=sha256:4f3d4471ee8c8be571318626760221d28eb833090cff3e0bcb78ff31702c5871

Observation 88d65af3-85e1-4685-92c3-21a1cf1abceb · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:57.027806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.185268Z digest=sha256:e2dcba760f7438f063d46e86f0c1cba1a6ddb7a79577f731103b84267fc4fc91

Observation 19c53cf2-4f48-41f8-b39f-d0811b0c152a · outbound

This paper cites DeepSeek-V3 Technical Report.

DABstep: Data Agent Benchmark for Multi-step Reasoning DeepSeek-V3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:52.243377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:52.243377Z digest=sha256:be30e7cbd86867f86c0377343c6efb3dccc7e86a777be9374c1e2413863b2217

Observation fa3a561c-799a-4c41-9755-3b739a34c96c · outbound

This paper cites Agentbench: Evaluating LLMs as agents.

DABstep: Data Agent Benchmark for Multi-step Reasoning Agentbench: Evaluating LLMs as agents

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.013855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.323582Z digest=sha256:c5ce64cd614c478c11530316574512c72347745b122b9d6f1ad8b9aee00f8d77

Observation f6874c40-368f-4d2e-a4bf-5b036e725406 · outbound

This paper cites Gaia: a benchmark for general ai assistants.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gaia: a benchmark for general ai assistants

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.000512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.416043Z digest=sha256:88c33bbed84da916469e820d67508dbf7319fee4e234ca8215f476d005824bfe

Observation 4ec8070a-dae3-43fa-add3-29b17f4fa92b · outbound

This paper cites GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.986853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.478008Z digest=sha256:3304cd810cf9b18bccc999557f905db627d95de3488a0e773d324330f90ef7a3

Observation f7bca586-d0ee-4c66-9e7c-3b1d8c93405e · outbound

This paper cites Introducing gpt-4o: Multimodal capabilities and efficiency.

DABstep: Data Agent Benchmark for Multi-step Reasoning Introducing gpt-4o: Multimodal capabilities and efficiency

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.973080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.556221Z digest=sha256:259f7078e07d004309d9786216bbd4377c7c28693854ed8245eccde4bf9fb43b

Observation 78f6950f-26f5-47ab-929c-f87abf9397ac · outbound

This paper cites Gpt-4o mini: advancing cost-efficient intelligence.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gpt-4o mini: advancing cost-efficient intelligence

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.959752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.644866Z digest=sha256:7004dc68a123a60066214d0291173515107d2fc8e64d93fc0b367fc766884a11

Observation 73e40c86-e70f-4a96-82ba-d258d2dd2bcd · outbound

This paper cites Openai o1 and new tools for developers.

DABstep: Data Agent Benchmark for Multi-step Reasoning Openai o1 and new tools for developers

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.947052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.711930Z digest=sha256:56781b3fc2c942e37ca7fb840d9099138f9849e7927210796187605c9222387c

Observation cfc5149b-3e5c-420a-8654-26d83a5f34dc · outbound

This paper cites Gpt-4.1 technical overview.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gpt-4.1 technical overview

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.933192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.775886Z digest=sha256:939044f3159ab4fc887cae7bb9a99356a74e9701484b42b8d6eda1b4698bb1f3

Observation 517e6610-118a-4502-bf78-2fbe3128c30b · outbound

This paper cites Introducing openai o3 and o4-mini.

DABstep: Data Agent Benchmark for Multi-step Reasoning Introducing openai o3 and o4-mini

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.841094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:52.865165Z digest=sha256:ca69be05580cd4d0ea8288cb8b33c1916a6e64f47d62916be316978d33cca16d

Observation 399e59f8-ea89-421d-b6e7-504fe3faaa0b · outbound

This paper cites On the Difficulty of Evaluating Baselines: A Study on Recommender Systems.

DABstep: Data Agent Benchmark for Multi-step Reasoning On the Difficulty of Evaluating Baselines: A Study on Recommender Systems

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:52.935613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:52.935613Z digest=sha256:470ac0c814d3cabf1af4a0c9db190ef0cf44a1bcb29cc13be75beb5605796114

Observation fd058908-c099-4d70-abbe-6dbc1cf6f90c · outbound

This paper cites smolagents: A smol library to build great agentic systems, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning smolagents: A smol library to build great agentic systems, 2025

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.721918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.007256Z digest=sha256:aba2108be21a50d7262ce6580936628f445127a4bd0a9d4c94e629761ed9001f

Observation 430eae7b-a90d-4ab3-828a-8f9fa0b44d0e · outbound

This paper cites Let me speak freely? a study on the impact of format restrictions on large language model performance.

DABstep: Data Agent Benchmark for Multi-step Reasoning Let me speak freely? a study on the impact of format restrictions on large language model performance

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.346199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.112099Z digest=sha256:b9fabc71c76f773083477448fef112215e68c47835b024a43bb7bb809bc0ea64

Observation 224fe5b7-773b-43ce-b753-7d3f9b33d125 · outbound

This paper cites Attention is all you need.

DABstep: Data Agent Benchmark for Multi-step Reasoning Attention is all you need

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.272722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.182266Z digest=sha256:aebae33a359e3ca84dd99d24461d5dbf12ee964d6667fae122eedb914dbbe521

Observation 2ad18714-dea3-48c9-9525-941ad833c1ce · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:56.144291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.266303Z digest=sha256:928f5868784ee73f2f38c9a57933284111a3baf9ed8397d2fc510825b8c1c6a9

Observation 9d799cd1-a372-4fb0-ab24-903b849b45f2 · outbound

This paper cites Text-to-sql generation for question answering on electronic medical records.

DABstep: Data Agent Benchmark for Multi-step Reasoning Text-to-sql generation for question answering on electronic medical records

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.993395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.317720Z digest=sha256:d8fb663e6127659501ea2e64aeddecfb04f691beaf0d8021704402229e6ca1d6

Observation 44fab7f5-6366-4e6f-a27a-ae3086d26246 · outbound

This paper cites Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks.

DABstep: Data Agent Benchmark for Multi-step Reasoning Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.792634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.399064Z digest=sha256:19ea1a6527113295725527b9ba7bdb6507ef7c8f4241589b5ee0525fa9937b45

Observation 9b3f0674-ec5c-47d2-a125-bb7ff1a64c01 · outbound

This paper cites Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.

DABstep: Data Agent Benchmark for Multi-step Reasoning Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.585395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.476819Z digest=sha256:08e66bde11c9af83213f2f7b864d3ab5d371a5b9f9d2c41d351e274660b38f14

Observation 1349b8da-5657-4278-9702-4815ef78a55e · outbound

This paper cites SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

DABstep: Data Agent Benchmark for Multi-step Reasoning SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:53.510368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:53.510368Z digest=sha256:574e4735e142085f08f2793f0f7d86b3e283488d98d848eda3dd2153b2dbe4d9

Observation d2b9a81d-d68c-4d9f-8bd1-90d789826100 · outbound

This paper cites Intercode: Standard- izing and benchmarking interactive coding with execution feedback.

DABstep: Data Agent Benchmark for Multi-step Reasoning Intercode: Standard- izing and benchmarking interactive coding with execution feedback

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.392738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.621416Z digest=sha256:833b3f93aa0d642465f42c89d1f978d2f7814ef41b964243169f685e1affad6d

Observation c985aa84-40ad-4478-ac04-5495149a8b6e · outbound

This paper cites React: Synergizing reasoning and acting in language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning React: Synergizing reasoning and acting in language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:53.686043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:53.686043Z digest=sha256:e2c0183229aff2ce2562dc660385dfdac3f27828bf32daa9689055c95884bd5c

Observation 5d723746-67cf-4626-afb7-cda7350050d1 · outbound

This paper cites Natural language to code generation in interactive data science notebooks.

DABstep: Data Agent Benchmark for Multi-step Reasoning Natural language to code generation in interactive data science notebooks

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.209547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.758304Z digest=sha256:a9f2fb03bdf7729aaa61d6a6a3c8aec4e2777b26f0e370afb306e36654b495a4

Observation 77c023b4-86c9-4cae-9759-955d778af1a0 · outbound

This paper cites Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task.

DABstep: Data Agent Benchmark for Multi-step Reasoning Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.982137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.855369Z digest=sha256:5dcb1ff6725852f0bd55e11055ef85758732c8c0e940fa938fade6f8934c89ea

Observation 4a5446d4-801b-45d5-87c1-bca8f374a499 · outbound

This paper cites Benchmarking data science agents.

DABstep: Data Agent Benchmark for Multi-step Reasoning Benchmarking data science agents

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.784644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:53.940982Z digest=sha256:a0c02bb945f2514e75825de66c45b6f7ff5d637c49be52017a6014ba6d45308a

Observation ba97e827-8b90-41de-ad74-e8d97748cfce · outbound

This paper cites Judging llm-as-a-judge with mt- bench and chatbot arena.

DABstep: Data Agent Benchmark for Multi-step Reasoning Judging llm-as-a-judge with mt- bench and chatbot arena

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.596063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:54.029828Z digest=sha256:9f7d236af7769a63b1a7924dac8b7c79baad02f2d599e31b912c1c3682df47e1

Observation 1a061464-ef55-4cea-8158-caa7e362e69a · outbound

This paper cites Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning.

DABstep: Data Agent Benchmark for Multi-step Reasoning Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:54.118777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:54.118777Z digest=sha256:58846cb264fe1b9810ec82f101b135af118b50ba520d24c188461bb865f63e6b

Observation 9c3f61fc-2d65-4c4c-9e34-3b2b93ff5e2a · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig.

DABstep: Data Agent Benchmark for Multi-step Reasoning Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.462473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T21:37:54.197640Z digest=sha256:31b8e82063229b6607c6b6dc7c0fffc7fa7ac80046488c570ce352a51d203cfa

Pith citing papers

Observation fb3c064e-2200-47d6-b291-ba24dc973c63 · inbound

DSBC : Data Science task Benchmarking with Context engineering cites this paper.

DSBC : Data Science task Benchmarking with Context engineering DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:23.455387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:53:23.455387Z digest=sha256:bcee3648b3487093902ff9f15a194cccfed78f6c1ccd3371fe81c8e0e7e691a1

Observation 3acc66b7-f3e8-4d21-bf40-9a6157ddbd12 · inbound

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data cites this paper.

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T11:38:48.980923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T11:38:48.980923Z digest=sha256:f8452f5c82a25e9161e7afa4f8357516fe4bb73f47fc4d929997d06e367aa91a

Observation 791502ba-261b-4ae2-9413-05d8da1a7934 · inbound

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows cites this paper.

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-16T22:48:38.295576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-16T22:43:48.618334Z digest=sha256:cd69df2137457a5ac3bce53cd401f88f7f11bd9acb109b6808a7ee6bc675669c

Observation 61775897-6a07-44a1-94e7-af61958cd931 · inbound

Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning cites this paper.

Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T10:11:02.007616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T15:37:27.639628Z digest=sha256:95f6d6f0d84981ead4f2e85b8e0d8280de913d4891d41124b6ff3825e56b6018

Observation 460546be-bfd7-4a7a-b7ef-6f93de34232d · inbound

KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving cites this paper.

KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:01:48.825266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T06:58:36.525442Z digest=sha256:61e4804cbe12951e9a9758229b273ce6b57ada8a0f5ede42d0eab44dd1867841

Observation f49fc793-54bd-435d-a09e-278b60ad2148 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:30:42.409816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-08T18:24:15.160643Z digest=sha256:2a513ee8f5bc0d7f0295f702bcedc963b8d293e02bbc14c915cf69e73405950b

Observation 0b1f780e-650b-4329-ae03-04d19bb71f99 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-21T00:29:17.482393Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-21T00:25:32.898938Z digest=sha256:8bec3973f2d00111e019d178d5b56b4a9048b139f90f39b7bd1a8c1209cfb7a6

Observation ccecea1c-66f2-4f47-b2d0-bd498e94c771 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:25:09.627139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-01T00:19:52.480293Z digest=sha256:5a3fc6aff3bb1c6ec8e79ca28727947748c46f0ad839ab3dd8e8734dadf76b27

Observation 8c5a8580-4aa7-4c60-a654-f250986eebe3 · inbound

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation? cites this paper.

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation? DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:31:25.531288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T01:01:40.043634Z digest=sha256:b073565a310d453ce7d7847476e664a696cff9ac3dac6b559d4135941a04eed1

Observation 3e073fb7-07c5-4eb4-8c3c-8895a3ed457b · inbound

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media cites this paper.

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 77

Resolution
verified exact
arxiv_id, observed 2026-05-21T04:53:57.793262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-21T04:52:44.897900Z digest=sha256:e94e684ef9220264d6bf2a7197385ee61a93625d97336ba27583f3c05a84674f

Observation 1f99a9bc-e4d2-4d84-9274-6d901d19469c · inbound

Agentic AI Workload Characteristics cites this paper.

Agentic AI Workload Characteristics DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T20:13:58.838083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-29T20:11:50.722787Z digest=sha256:1f022072640c984ead0434de21b1a2c48ad53c255531d72611dfdd6f6c03777c

Observation 96694f58-b1a6-4369-bcc7-b9e9f682099e · inbound

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis cites this paper.

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T09:03:16.042821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-29T08:56:24.657380Z digest=sha256:d0d18b25b98be66a0ce75e5aa1e5535912b4e99bf94fb749194ea878e982e44e

Observation 886e156f-5d39-488e-870b-2fbb2dc4bde2 · inbound

VESTA: Visual Exploration with Statistical Tool Agents cites this paper.

VESTA: Visual Exploration with Statistical Tool Agents DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:56:10.467893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-28T21:58:11.339217Z digest=sha256:32066d1f95a264f8a5987a8efd5689c8dbbe4d945752cf4ecf2ef546db43b5e2

Observation dcd5dbcc-62f6-4266-b7f2-0a5ca6772369 · inbound

Unsupervised Skill Discovery for Agentic Data Analysis cites this paper.

Unsupervised Skill Discovery for Agentic Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-06-28T01:21:29.003098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-28T01:13:03.634348Z digest=sha256:b6ee3be54ab81ff0c132e4003613db35298e083d6a211dd9c0eafa03f14e3c92

Observation 8c333f4e-6b57-4919-93b9-576aafae6069 · inbound

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science cites this paper.

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T17:48:46.123976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-06-27T03:42:40.528376Z digest=sha256:6db4313dfc0f55b0e5c517dbe7a9ad47760e14610ad0bf2547f2f757c05f8c78

Observation cdcd41e0-5419-459c-81eb-a60d331ce251 · inbound

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents cites this paper.

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T02:18:45.651355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T02:18:45.651355Z digest=sha256:7e5f9ff63eb08763fd969979e3941c4ecfce40296a56189e3911d2108ca6b379

Observation 4841dbd9-2b56-4d6f-86b1-d410a2e6897b · inbound

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery cites this paper.

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T22:27:23.366415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T22:27:23.366415Z digest=sha256:166a7b9e80505f7e9dafb8c9a4e8a586fcab691bf2b935d4c29af4aa631172c3

Observation 476bc867-a9d9-4d3b-afc6-a0fe2646229b · inbound

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation cites this paper.

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-01T01:16:43.824531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T01:16:43.824531Z digest=sha256:8e4675651316d4e3ad6ed3479f4791f6de0ff65eecf3b876d543034a390fd3c2

Observation b9c22f85-25f8-41b1-8fae-261cc4c9ba4c · inbound

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks cites this paper.

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-30T22:55:11.426393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:55:11.426393Z digest=sha256:c0b69f4c37f9a33d2f9a56ec79d4827e279be2a83d8cf92dc79dcaf580c77230

Observation 2b6306c8-17af-4a00-bd30-9d2331ff07a6 · inbound

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness cites this paper.

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-31T19:54:08.368823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T19:54:08.368823Z digest=sha256:1fa08df5ae89b5df7c6b4a1d829cb59ebdb2b3906fffa4cb488d9585f6ce268f

Observation 644faab7-ad14-4c37-b046-38a7b75ab743 · inbound

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing cites this paper.

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T04:39:03.430946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T04:39:03.430946Z digest=sha256:96512f984916d17d6dbbfb480590067e2a36cb3996f99cf333a66d61032b039f