Pith. sign in

Paper Citation Record · LEDGER

DABstep: Data Agent Benchmark for Multi-step Reasoning

As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 20 inbound Pith citation observations for arXiv:2506.23719.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.23719 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:37:54.197640Z

measured 71 of 71 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 20 of 20 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:53:23.455387Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact0
  • verified fuzzy35
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 4d315fcc-0848-49ac-96e1-6050c8eafbb1 · outbound

This paper cites Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.

DABstep: Data Agent Benchmark for Multi-step Reasoning Llama 3.2: Revolutionizing edge ai and vision with open, customizable models

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.279909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.333473Z digest=sha256:aca7348f0da56c019cb6f018b2829ecd801e1df6c7b643070ba328b7711187c8

Observation 9c41d26e-68ac-488d-8c30-1c7a2a243d09 · outbound

This paper cites The llama 4 herd: The beginning of a new era of natively multimodal ai innovation.

DABstep: Data Agent Benchmark for Multi-step Reasoning The llama 4 herd: The beginning of a new era of natively multimodal ai innovation

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.267190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.377890Z digest=sha256:b301b0fa9e10158bedcfa7262c29c9377e340bccb3fe68515b84a962759c3e2c

Observation 53a705c0-6657-455f-819c-9013f35389f5 · outbound

This paper cites Claude 3.5: Next-generation language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning Claude 3.5: Next-generation language models

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.254588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.463981Z digest=sha256:2e305e7b9bcaf4ed085d7c80b5c2ffebf37df71398f6b3079f013ce532923918

Observation c216f380-c155-4219-a7c5-bb70cd4309b3 · outbound

This paper cites Claude 3.7: Advancements in language understanding.

DABstep: Data Agent Benchmark for Multi-step Reasoning Claude 3.7: Advancements in language understanding

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.241879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.507926Z digest=sha256:3cfb10f71e1d6921ccad882749f0d1d6aefb6dbbc1a727f20729111fde195691

Observation 13d8d062-c7cf-449e-bfc8-21c54f844013 · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:57.228911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.590499Z digest=sha256:705fe73038d373311ae129d28717cb0873b140056b0dd9d32687221edfed82de

Observation dbeba95d-0dd7-46bf-9482-91eef5049960 · outbound

This paper cites MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering.

DABstep: Data Agent Benchmark for Multi-step Reasoning MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.650169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.650169Z digest=sha256:4d3fb022b5ddfeb2333d8508ecd9c04d2fc6819aef2869b7d5ff8b9c28208aa0

Observation 5c594346-2d69-4e4f-a8d5-abcdcee3746b · outbound

This paper cites Evaluating Large Language Models Trained on Code.

DABstep: Data Agent Benchmark for Multi-step Reasoning Evaluating Large Language Models Trained on Code

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.711814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.711814Z digest=sha256:b72b0f43b8780f859521863e25ccbfa692c61c0f2e42e32c78c51d2ee23827da

Observation 39c164cf-b273-49ef-92df-ad7218e1e9ff · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

DABstep: Data Agent Benchmark for Multi-step Reasoning Training Verifiers to Solve Math Word Problems

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.787132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.787132Z digest=sha256:e35a8f6bf38b5f6c5607e88f31f52a3b8c900ec6758b1644966dd7ccbf83af4d

Observation be278e08-16aa-4dc6-8875-c0a78999081d · outbound

This paper cites Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste.

DABstep: Data Agent Benchmark for Multi-step Reasoning Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.215894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.852268Z digest=sha256:a3ca9365819f635fbda8d55c1f92d225dc9e3610b6a2c2f47651c06351068189

Observation 25d5083f-57c2-4d75-8493-b73cee719fda · outbound

This paper cites Gemini 2.5: Our most intelligent ai model, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gemini 2.5: Our most intelligent ai model, 2025

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.202284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:50.943251Z digest=sha256:fe180445aac05fffd8d27d4f0272229e9d830c3f7c81331c2f0590d38d996419

Observation f42eff18-f0fa-41d3-80dc-ac02d16b4a38 · outbound

This paper cites The Llama 3 Herd of Models.

DABstep: Data Agent Benchmark for Multi-step Reasoning The Llama 3 Herd of Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:50.993213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:50.993213Z digest=sha256:31f6e0bd84a59d8082cba9ceca1763185a0b97618706f2de398719cf0076294a

Observation 6923dfeb-86cc-480d-8a21-377f4f3458b5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

DABstep: Data Agent Benchmark for Multi-step Reasoning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.085757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.085757Z digest=sha256:b54e2197bfa36c0941e2e9326932b1d5b5fec285c0d2b01bb37455b18bc00db0

Observation efd09a51-46ec-42ea-b264-43336721becc · outbound

This paper cites Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data.

DABstep: Data Agent Benchmark for Multi-step Reasoning Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.186096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.166759Z digest=sha256:99e5af623e3a54e8c4439866fcfd57bacf46b763ab80539405e0536c6bbf0f3c

Observation d60b1519-3c14-4765-a5db-57d57519602f · outbound

This paper cites Measuring mathematical problem solving with the MATH dataset.

DABstep: Data Agent Benchmark for Multi-step Reasoning Measuring mathematical problem solving with the MATH dataset

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.172170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.238203Z digest=sha256:8ee021c538f0f9e4d2203541f09eb72f590b6bec5ecd8544333b377a2d18314c

Observation 3e367110-4d52-4d25-adb3-e8549ba96535 · outbound

This paper cites InfiAgent-DABench: Evaluating agents on data analysis tasks.

DABstep: Data Agent Benchmark for Multi-step Reasoning InfiAgent-DABench: Evaluating agents on data analysis tasks

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.158449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.368894Z digest=sha256:6639ce5bf1827b6c09d2f054c92a8269bc0f936332d19f80904ea815b1c0b599

Observation 1977c770-4d5b-46ae-a20c-82fba8066dfc · outbound

This paper cites Mlagentbench: evaluating language agents on machine learning experimentation.

DABstep: Data Agent Benchmark for Multi-step Reasoning Mlagentbench: evaluating language agents on machine learning experimentation

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.144688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.414910Z digest=sha256:d1530a4f9b1fdb23593bce2f22f9a36bf6ba5b651cf1f986e56d439e5dd29d97

Observation 87af90cf-60bb-4edd-87e6-13c81dee47b3 · outbound

This paper cites DA-code: Agent data science code generation benchmark for large language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning DA-code: Agent data science code generation benchmark for large language models

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.125954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.518323Z digest=sha256:df1383979f97e9c5f18c1b91e2fe0453d7215cb45fdb517ac9bcd36de8a289a3

Observation e6b73b48-8231-49a3-9207-fffff11dea19 · outbound

This paper cites Financebench: A new benchmark for financial question answering, 2023.

DABstep: Data Agent Benchmark for Multi-step Reasoning Financebench: A new benchmark for financial question answering, 2023

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.577389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.577389Z digest=sha256:366e3061e3afbeccdce327f4c4e963c129d610644ea3345bd0c9f80723e84bdc

Observation 1ffd4f8f-cb5e-426f-814c-8932093f66a5 · outbound

This paper cites SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024.

DABstep: Data Agent Benchmark for Multi-step Reasoning SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.695010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.695010Z digest=sha256:c6e0d04f551611edd668a590191e6646655867b1ac768bc636064f037b00ef58

Observation dad541e7-06b3-471f-85c6-5da7590a891b · outbound

This paper cites DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.093190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.782173Z digest=sha256:9e6e251bf20fbab16de27ad2b010d615157fd4956bd1d9f0f5a2c3d3cf60c706

Observation a3da2933-c194-4152-9803-8d353273e5cd · outbound

This paper cites Ds-1000: A natural and reliable benchmark for data science code generation.

DABstep: Data Agent Benchmark for Multi-step Reasoning Ds-1000: A natural and reliable benchmark for data science code generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:51.897687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:51.897687Z digest=sha256:d011ea2442a592f58a8cc40f2a866b65b0ba231f0f67fe22480a1b4ddc130dc6

Observation ccad99ba-4c64-4542-9986-c7e4cd043976 · outbound

This paper cites KaggleDBQA: Realistic eval- uation of text-to-SQL parsers.

DABstep: Data Agent Benchmark for Multi-step Reasoning KaggleDBQA: Realistic eval- uation of text-to-SQL parsers

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.069791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:51.960292Z digest=sha256:73e8afe08394ae79eacd572e9c0371ad38cd13c22d599df7af61a76f00cff09c

Observation ad14efe0-2847-4d41-90b9-c4c0929c0bac · outbound

This paper cites Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows.

DABstep: Data Agent Benchmark for Multi-step Reasoning Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.056301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.035704Z digest=sha256:8f8d2fc59f7ae4e714132863b7f3a5fd545acb2d8a8654b4c2278e8648d26ead

Observation f69aea46-4d3c-4d41-ad35-33788897ee2f · outbound

This paper cites Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls.

DABstep: Data Agent Benchmark for Multi-step Reasoning Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.042324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.115929Z digest=sha256:829a1b1b3a54d8e0f674b6c8f33557c828aaa94933d42808065bc14a1f5c62b1

Observation 88d65af3-85e1-4685-92c3-21a1cf1abceb · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:57.027806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.185268Z digest=sha256:c9a3cabf61e91d392d64a4f33416a3ff606a59f3cfda3735e7f43adfe1b384dd

Observation 19c53cf2-4f48-41f8-b39f-d0811b0c152a · outbound

This paper cites DeepSeek-V3 Technical Report.

DABstep: Data Agent Benchmark for Multi-step Reasoning DeepSeek-V3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:52.243377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:52.243377Z digest=sha256:1e1a64eb9b2798dd6532987f9a980d8d49b977a496d1622b93e9b1029c4b9b4b

Observation fa3a561c-799a-4c41-9755-3b739a34c96c · outbound

This paper cites Agentbench: Evaluating LLMs as agents.

DABstep: Data Agent Benchmark for Multi-step Reasoning Agentbench: Evaluating LLMs as agents

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.013855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.323582Z digest=sha256:24e0aba8190067861340f66ac2e161e3415e19f1c8e69d5077785c7c4b82fcba

Observation f6874c40-368f-4d2e-a4bf-5b036e725406 · outbound

This paper cites Gaia: a benchmark for general ai assistants.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gaia: a benchmark for general ai assistants

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:57.000512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.416043Z digest=sha256:defa9c4aa5b5970f48d7a69d8097ea753f83bcc04d6313476407c5eff44c6fc4

Observation 4ec8070a-dae3-43fa-add3-29b17f4fa92b · outbound

This paper cites GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.986853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.478008Z digest=sha256:9f5ea8c1719fae481b46c08247792d3736c3b787d23a8fb8045103a1a1ddfad6

Observation f7bca586-d0ee-4c66-9e7c-3b1d8c93405e · outbound

This paper cites Introducing gpt-4o: Multimodal capabilities and efficiency.

DABstep: Data Agent Benchmark for Multi-step Reasoning Introducing gpt-4o: Multimodal capabilities and efficiency

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.973080Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.556221Z digest=sha256:629be00b2bf71e72168b8e5af2a749c1e037f3803769b270302f88840f12d4f8

Observation 78f6950f-26f5-47ab-929c-f87abf9397ac · outbound

This paper cites Gpt-4o mini: advancing cost-efficient intelligence.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gpt-4o mini: advancing cost-efficient intelligence

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.959752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.644866Z digest=sha256:b0230dba3c9a9ad2f80f75b0625179bd3a4ee3b0e752b0058eaed4b98e20dffb

Observation 73e40c86-e70f-4a96-82ba-d258d2dd2bcd · outbound

This paper cites Openai o1 and new tools for developers.

DABstep: Data Agent Benchmark for Multi-step Reasoning Openai o1 and new tools for developers

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.947052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.711930Z digest=sha256:71aa7446599fbac45e20aae33701df9ae8f6bf0e625359027769f62f86c93c8d

Observation cfc5149b-3e5c-420a-8654-26d83a5f34dc · outbound

This paper cites Gpt-4.1 technical overview.

DABstep: Data Agent Benchmark for Multi-step Reasoning Gpt-4.1 technical overview

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.933192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.775886Z digest=sha256:d4d6bbcec6428574f63f44777e314f660cccdc1523599391f924723c5f651f88

Observation 517e6610-118a-4502-bf78-2fbe3128c30b · outbound

This paper cites Introducing openai o3 and o4-mini.

DABstep: Data Agent Benchmark for Multi-step Reasoning Introducing openai o3 and o4-mini

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.841094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:52.865165Z digest=sha256:a18768a8631d86eb6ec1e4650cd4d386abf3871b6ef67f38ca349868735e96cc

Observation 399e59f8-ea89-421d-b6e7-504fe3faaa0b · outbound

This paper cites On the Difficulty of Evaluating Baselines: A Study on Recommender Systems.

DABstep: Data Agent Benchmark for Multi-step Reasoning On the Difficulty of Evaluating Baselines: A Study on Recommender Systems

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:52.935613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:52.935613Z digest=sha256:53f539d9365da08cbbbe414707a09f560deb90dec083ff415f3e3322b942919a

Observation fd058908-c099-4d70-abbe-6dbc1cf6f90c · outbound

This paper cites smolagents: A smol library to build great agentic systems, 2025.

DABstep: Data Agent Benchmark for Multi-step Reasoning smolagents: A smol library to build great agentic systems, 2025

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.721918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.007256Z digest=sha256:475a7417dfaec20bde68b4b687df72e1beda86205f34a41edadb891793f70bc5

Observation 430eae7b-a90d-4ab3-828a-8f9fa0b44d0e · outbound

This paper cites Let me speak freely? a study on the impact of format restrictions on large language model performance.

DABstep: Data Agent Benchmark for Multi-step Reasoning Let me speak freely? a study on the impact of format restrictions on large language model performance

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.346199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.112099Z digest=sha256:2ef01e2673c59e860e9dd48e0587531bfab6a13e0196bad5d739cdbba45d35ca

Observation 224fe5b7-773b-43ce-b753-7d3f9b33d125 · outbound

This paper cites Attention is all you need.

DABstep: Data Agent Benchmark for Multi-step Reasoning Attention is all you need

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:56.272722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.182266Z digest=sha256:30ed2dafc14d1ae6e1363040d3c7cd12b0c0c28f7df8571f6b536df9dadb124d

Observation 2ad18714-dea3-48c9-9525-941ad833c1ce · outbound

This paper cites an unresolved cited work.

DABstep: Data Agent Benchmark for Multi-step Reasoning Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:37:56.144291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.266303Z digest=sha256:3ee0684c478387a4d444b91dea4cb0aab93a1690332fd13ed9d8964eaf84d3c3

Observation 9d799cd1-a372-4fb0-ab24-903b849b45f2 · outbound

This paper cites Text-to-sql generation for question answering on electronic medical records.

DABstep: Data Agent Benchmark for Multi-step Reasoning Text-to-sql generation for question answering on electronic medical records

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.993395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.317720Z digest=sha256:27c328e8bcd571a20f3d46822a6915ff83d528572b6b75d27704a11ec47840fb

Observation 44fab7f5-6366-4e6f-a27a-ae3086d26246 · outbound

This paper cites Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks.

DABstep: Data Agent Benchmark for Multi-step Reasoning Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.792634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.399064Z digest=sha256:269de5b580dfc98ad63cb71546f8aa31765193b7716dd28abe448c069cf7d22c

Observation 9b3f0674-ec5c-47d2-a125-bb7ff1a64c01 · outbound

This paper cites Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.

DABstep: Data Agent Benchmark for Multi-step Reasoning Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.585395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.476819Z digest=sha256:0237a9f5f7cefc47991b3e17387d83a40f4a67bf10dec45b4f737d508fd926b2

Observation 1349b8da-5657-4278-9702-4815ef78a55e · outbound

This paper cites SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

DABstep: Data Agent Benchmark for Multi-step Reasoning SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:53.510368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:53.510368Z digest=sha256:b64258036258bd28af13db6a79917307f4dfbe2fc21bfea8bd095aa233455432

Observation d2b9a81d-d68c-4d9f-8bd1-90d789826100 · outbound

This paper cites Intercode: Standard- izing and benchmarking interactive coding with execution feedback.

DABstep: Data Agent Benchmark for Multi-step Reasoning Intercode: Standard- izing and benchmarking interactive coding with execution feedback

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.392738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.621416Z digest=sha256:93544db323c74255d8623df991b9b303b75c8a76b81cbbfdc4b67aa57c793858

Observation c985aa84-40ad-4478-ac04-5495149a8b6e · outbound

This paper cites React: Synergizing reasoning and acting in language models.

DABstep: Data Agent Benchmark for Multi-step Reasoning React: Synergizing reasoning and acting in language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:53.686043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:53.686043Z digest=sha256:a0d46a2d0c244e9cf960b83a534406a030e862123aa35350fe304b7079025072

Observation 5d723746-67cf-4626-afb7-cda7350050d1 · outbound

This paper cites Natural language to code generation in interactive data science notebooks.

DABstep: Data Agent Benchmark for Multi-step Reasoning Natural language to code generation in interactive data science notebooks

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:55.209547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.758304Z digest=sha256:8a78cd56015828b493f7639f67e0d196879e1368073bfd643e6587f6b2a0c5a5

Observation 77c023b4-86c9-4cae-9759-955d778af1a0 · outbound

This paper cites Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task.

DABstep: Data Agent Benchmark for Multi-step Reasoning Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.982137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.855369Z digest=sha256:115a7a669b39a14d6bfcdd2e38ada199dd1d640c410d6d0dcbd04075898db7ed

Observation 4a5446d4-801b-45d5-87c1-bca8f374a499 · outbound

This paper cites Benchmarking data science agents.

DABstep: Data Agent Benchmark for Multi-step Reasoning Benchmarking data science agents

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.784644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:53.940982Z digest=sha256:b72148c66d770ae899a83f0da6e4ed59110fcb9938e6717b63c6c6040b3ad80e

Observation ba97e827-8b90-41de-ad74-e8d97748cfce · outbound

This paper cites Judging llm-as-a-judge with mt- bench and chatbot arena.

DABstep: Data Agent Benchmark for Multi-step Reasoning Judging llm-as-a-judge with mt- bench and chatbot arena

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.596063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:54.029828Z digest=sha256:ee8bb65f49210a2770e6705b0a3c439babbbafda02c2c37bd3518fdae5d3caea

Observation 1a061464-ef55-4cea-8158-caa7e362e69a · outbound

This paper cites Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning.

DABstep: Data Agent Benchmark for Multi-step Reasoning Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T21:37:54.118777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:37:54.118777Z digest=sha256:979414ac3614e8831abc9946f63ccaacbefcdc3e9263dfdda8c95fd7e34ae6b2

Observation 9c3f61fc-2d65-4c4c-9e34-3b2b93ff5e2a · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig.

DABstep: Data Agent Benchmark for Multi-step Reasoning Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:37:54.462473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:37:54.197640Z digest=sha256:508f235b0fd82ef89160f3db598d489617852b9f441a6eb8dfb71457c8d9bc38

Pith citing papers

Observation fb3c064e-2200-47d6-b291-ba24dc973c63 · inbound

DSBC : Data Science task Benchmarking with Context engineering cites this paper.

DSBC : Data Science task Benchmarking with Context engineering DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:23.455387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:53:23.455387Z digest=sha256:03649376a5268d7cc4b969fd02439e9c94284e66035381790ce08cfcdee92dfc

Observation 3acc66b7-f3e8-4d21-bf40-9a6157ddbd12 · inbound

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data cites this paper.

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T11:38:48.980923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T11:38:48.980923Z digest=sha256:e2e9930cbd709faccbe4a2c2ac45cd210c3ffc9fa2dd8909c1e68c43c34f648b

Observation 791502ba-261b-4ae2-9413-05d8da1a7934 · inbound

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows cites this paper.

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-16T22:48:38.295576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-16T22:43:48.618334Z digest=sha256:7edb9983d66e9e47b0efc336e17c9d32486199feefed7d86355d7dd7b9148faa

Observation 61775897-6a07-44a1-94e7-af61958cd931 · inbound

Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning cites this paper.

Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T10:11:02.007616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T15:37:27.639628Z digest=sha256:6603b9e319fae5c46dae1b96f2fec2c6711263f73f3df8ad7cfab2a1d0e5cae9

Observation 460546be-bfd7-4a7a-b7ef-6f93de34232d · inbound

KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving cites this paper.

KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:01:48.825266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T06:58:36.525442Z digest=sha256:9e3f3b5910ecc070c030b9241ee211a728bad8a28efd0de42ccacd7b514bb763

Observation f49fc793-54bd-435d-a09e-278b60ad2148 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:30:42.409816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-08T18:24:15.160643Z digest=sha256:761532faccd62576c5e948abdca7b01f3973da731611cddf67d23de6b8eb240b

Observation 0b1f780e-650b-4329-ae03-04d19bb71f99 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-21T00:29:17.482393Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-21T00:25:32.898938Z digest=sha256:df40e723a2f9f5fddc7a99ac8f589a0e98eaf38d1cb2c182fc0ce7ba7b24acfb

Observation ccecea1c-66f2-4f47-b2d0-bd498e94c771 · inbound

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis cites this paper.

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:25:09.627139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-07-01T00:19:52.480293Z digest=sha256:21568413359f1e887cbba42a386afbd8be5845607de89c059fc223b60827f45b

Observation 8c5a8580-4aa7-4c60-a654-f250986eebe3 · inbound

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation? cites this paper.

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation? DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:31:25.531288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T01:01:40.043634Z digest=sha256:625cfd437d5ac6fb13c3df83d413d9ae3b933f98a7b83821e539951471fb45d4

Observation 3e073fb7-07c5-4eb4-8c3c-8895a3ed457b · inbound

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media cites this paper.

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 77

Resolution
verified exact
arxiv_id, observed 2026-05-21T04:53:57.793262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-21T04:52:44.897900Z digest=sha256:8cf804c375d358b5379f579fc95a491d0df8cb79109fa358859b2eb81c024285

Observation 1f99a9bc-e4d2-4d84-9274-6d901d19469c · inbound

Agentic AI Workload Characteristics cites this paper.

Agentic AI Workload Characteristics DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T20:13:58.838083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-29T20:11:50.722787Z digest=sha256:d1ac58a7cc2f2196df52b8e9e37b7b6bbcc9fc03ad6eac4c54a44c0152f90644

Observation 96694f58-b1a6-4369-bcc7-b9e9f682099e · inbound

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis cites this paper.

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T09:03:16.042821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-29T08:56:24.657380Z digest=sha256:5258b0a3eb1934db762a167c170b5b7d64bfb3219ae681be525e864ead3a75f7

Observation 886e156f-5d39-488e-870b-2fbb2dc4bde2 · inbound

VESTA: Visual Exploration with Statistical Tool Agents cites this paper.

VESTA: Visual Exploration with Statistical Tool Agents DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:56:10.467893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-28T21:58:11.339217Z digest=sha256:74444a297c4f03b0c99713bc86af76aec90c2b82fed34ad45053ed5e98a5d260

Observation dcd5dbcc-62f6-4266-b7f2-0a5ca6772369 · inbound

Unsupervised Skill Discovery for Agentic Data Analysis cites this paper.

Unsupervised Skill Discovery for Agentic Data Analysis DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-06-28T01:21:29.003098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-28T01:13:03.634348Z digest=sha256:9511e1cd2b17da5152d22c250f2851d21700e8e4c0ce9547c463a04b8e295ce2

Observation 8c333f4e-6b57-4919-93b9-576aafae6069 · inbound

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science cites this paper.

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T17:48:46.123976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-27T03:42:40.528376Z digest=sha256:40cc93d99f547b3ff4f147ec210455133f2fe01fc232babd576db4326dcedd88

Observation cdcd41e0-5419-459c-81eb-a60d331ce251 · inbound

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents cites this paper.

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T02:18:45.651355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T02:18:45.651355Z digest=sha256:458d914c474f11f7c906dad2d5bd2d6860de55f8833a3f2837c0ac8e2acb328c

Observation 4841dbd9-2b56-4d6f-86b1-d410a2e6897b · inbound

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery cites this paper.

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T22:27:23.366415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T22:27:23.366415Z digest=sha256:9a359afc3d481af4e2f3fe52ad4ae55d750076d7ec11cc4c4045b40abbfd2340

Observation 476bc867-a9d9-4d3b-afc6-a0fe2646229b · inbound

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation cites this paper.

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-01T01:16:43.824531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T01:16:43.824531Z digest=sha256:d51bb549b8d21a78524546a006044f0838ecf626f80009e97d2f43cf94a1eb47

Observation b9c22f85-25f8-41b1-8fae-261cc4c9ba4c · inbound

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks cites this paper.

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-30T22:55:11.426393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:55:11.426393Z digest=sha256:08dc3bde1ce92e97f6e893acdb6844fe764319ba536da6591e42eb53a633c53b

Observation 2b6306c8-17af-4a00-bd30-9d2331ff07a6 · inbound

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness cites this paper.

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness DABstep: Data Agent Benchmark for Multi-step Reasoning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-31T19:54:08.368823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T19:54:08.368823Z digest=sha256:484014cb54d091c33944efad76def165927c6f915ec5a50eb466cbf3acac2411