{"as_of":"2026-08-10T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b5dc296f4fed019b3a816d399e3308cd6150eebabb5d5dec67a08e3fe7eb335","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:54.197640Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:39:03.430946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-06T10:53:23.455387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23336","last_updated":"2025-08-06T18:41:57Z","snapshot_observed_at":"2026-08-06T10:53:21.465965Z","submitted_at":"2025-07-31T08:32:37Z","title":"DSBC : Data Science task Benchmarking with Context engineering","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T10:53:23.455387Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2507.23336"},"observation_digest":"sha256:03649376a5268d7cc4b969fd02439e9c94284e66035381790ce08cfcdee92dfc","observation_id":"fb3c064e-2200-47d6-b291-ba24dc973c63","resolution":{"observed_at":"2026-08-06T10:53:23.455387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T11:38:48.980923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02473","last_updated":"2026-05-29T10:01:49Z","snapshot_observed_at":"2026-08-08T14:12:42.899661Z","submitted_at":"2025-09-02T16:25:12Z","title":"FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:48.980923Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2509.02473"},"observation_digest":"sha256:e2e9930cbd709faccbe4a2c2ac45cd210c3ffc9fa2dd8909c1e68c43c34f648b","observation_id":"3acc66b7-f3e8-4d21-bf40-9a6157ddbd12","resolution":{"observed_at":"2026-08-05T11:38:48.980923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2512.13168","last_updated":"2026-04-15T17:46:00Z","snapshot_observed_at":"2026-08-08T14:46:54.054418Z","submitted_at":"2025-12-15T10:28:45Z","title":"Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T22:43:48.618334Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2512.13168"},"observation_digest":"sha256:fb5843dc46ea11d6e9c896b328e871e5b4807e5d1eb02c01f7c4fe843746d0df","observation_id":"791502ba-261b-4ae2-9413-05d8da1a7934","resolution":{"observed_at":"2026-05-16T22:48:38.295576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2604.10516","last_updated":"2026-04-26T12:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T08:14:39Z","title":"Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:27.639628Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2604.10516"},"observation_digest":"sha256:d782942d9119df738b45f5571ec13573bda8c8f2b5b80b72b83bce4e4ac3af9d","observation_id":"61775897-6a07-44a1-94e7-af61958cd931","resolution":{"observed_at":"2026-05-11T10:11:02.007616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2604.16682","last_updated":"2026-04-17T20:39:25Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T20:39:25Z","title":"KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:58:36.525442Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2604.16682"},"observation_digest":"sha256:8fc69b48e871d81974047d6efd5ccbab92defc85e9463841c6c4a603d4603fba","observation_id":"460546be-bfd7-4a7a-b7ef-6f93de34232d","resolution":{"observed_at":"2026-05-10T07:01:48.825266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:24:15.160643Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:a871777dccd6d443200437b2bc05beea0c3d531e0f3f71d40391c6b002c92edf","observation_id":"f49fc793-54bd-435d-a09e-278b60ad2148","resolution":{"observed_at":"2026-05-09T06:30:42.409816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T00:25:32.898938Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:f7af2053610def360bb781831f73dcbaa01a5c392a3b41c4173f6950efeaa2ed","observation_id":"0b1f780e-650b-4329-ae03-04d19bb71f99","resolution":{"observed_at":"2026-05-21T00:29:17.482393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.02503","last_updated":"2026-05-27T09:45:47Z","snapshot_observed_at":"2026-08-02T19:40:05.951592Z","submitted_at":"2026-05-04T11:57:09Z","title":"DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T00:19:52.480293Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.02503"},"observation_digest":"sha256:99aee8856df3d4f2cc048b7d3ee3bf10a09c6f2ec1e9de30876434eed3a82728","observation_id":"ccecea1c-66f2-4f47-b2d0-bd498e94c771","resolution":{"observed_at":"2026-07-01T00:25:09.627139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.08687","last_updated":"2026-05-09T04:52:47Z","snapshot_observed_at":"2026-08-03T23:56:12.463996Z","submitted_at":"2026-05-09T04:52:47Z","title":"PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:01:40.043634Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.08687"},"observation_digest":"sha256:0b43d7ba62546ec5360f2a6343001a9e8ab0778aa9f148b4ecafe2ab46c641d6","observation_id":"8c5a8580-4aa7-4c60-a654-f250986eebe3","resolution":{"observed_at":"2026-05-12T08:31:25.531288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.21338","last_updated":"2026-05-20T16:05:05Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T16:05:05Z","title":"Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-21T04:52:44.897900Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.21338"},"observation_digest":"sha256:1cf8e00904c8e6f1224eccd62f62f925207eb08e193a18632fc3087c3235047e","observation_id":"3e073fb7-07c5-4eb4-8c3c-8895a3ed457b","resolution":{"observed_at":"2026-05-21T04:53:57.793262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.26297","last_updated":"2026-05-25T19:45:21Z","snapshot_observed_at":"2026-08-03T04:38:08.316378Z","submitted_at":"2026-05-25T19:45:21Z","title":"Agentic AI Workload Characteristics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T20:11:50.722787Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.26297"},"observation_digest":"sha256:25e449a3307ecc6929168b2ea622891e3f579d33fb647e5168097916caf0f1d6","observation_id":"1f99a9bc-e4d2-4d84-9274-6d901d19469c","resolution":{"observed_at":"2026-06-29T20:13:58.838083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2605.30434","last_updated":"2026-05-28T18:00:20Z","snapshot_observed_at":"2026-07-06T23:39:43.967889Z","submitted_at":"2026-05-28T18:00:20Z","title":"LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:56:24.657380Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2605.30434"},"observation_digest":"sha256:829192d3b59df21ffdb801ec11f0d6ec81fc7a7529259fbbdd1f8635f6dc9367","observation_id":"96694f58-b1a6-4369-bcc7-b9e9f682099e","resolution":{"observed_at":"2026-06-29T09:03:16.042821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.00384","last_updated":"2026-06-07T19:48:24Z","snapshot_observed_at":"2026-08-08T23:35:17.895270Z","submitted_at":"2026-05-29T21:57:37Z","title":"VESTA: Visual Exploration with Statistical Tool Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T21:58:11.339217Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.00384"},"observation_digest":"sha256:8fc216287ed4781f80f42668f26d7ed550c4e4768745b6c6b0bc5d84e6d6460e","observation_id":"886e156f-5d39-488e-870b-2fbb2dc4bde2","resolution":{"observed_at":"2026-07-01T19:56:10.467893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.06416","last_updated":"2026-06-04T17:20:47Z","snapshot_observed_at":"2026-08-09T13:16:44.407700Z","submitted_at":"2026-06-04T17:20:47Z","title":"Unsupervised Skill Discovery for Agentic Data Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T01:13:03.634348Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.06416"},"observation_digest":"sha256:aac3dc922799fbc2dd803219099cde5ea3b4ada44244d7400ecfd5baf7be8574","observation_id":"dcd5dbcc-62f6-4266-b7f2-0a5ca6772369","resolution":{"observed_at":"2026-06-28T01:21:29.003098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":"2506.23719","doi":"10.48550/arxiv.2506.23719","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dabstep: Data agent benchmark for multi-step reasoning","venue":"ArXiv.org","work_id":"85862d27-eefc-4f5e-aa5d-26d6d6b7b24e","year":2025},"citing_paper":{"arxiv_id":"2606.16000","last_updated":"2026-06-16T21:25:39Z","snapshot_observed_at":"2026-08-02T17:38:04.521168Z","submitted_at":"2026-06-14T19:58:06Z","title":"GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T03:42:40.528376Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2606.16000"},"observation_digest":"sha256:3532ef961cc2268050c4a78b5b31370004bcadab9bbf9e583834451703c9488d","observation_id":"8c333f4e-6b57-4919-93b9-576aafae6069","resolution":{"observed_at":"2026-07-03T17:48:46.123976Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-02T02:18:45.651355Z","title":"arXiv preprint arXiv:2506.23719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14386","last_updated":"2026-07-15T22:01:21Z","snapshot_observed_at":"2026-08-08T01:19:24.103488Z","submitted_at":"2026-07-15T22:01:21Z","title":"CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T02:18:45.651355Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.14386"},"observation_digest":"sha256:458d914c474f11f7c906dad2d5bd2d6860de55f8833a3f2837c0ac8e2acb328c","observation_id":"cdcd41e0-5419-459c-81eb-a60d331ce251","resolution":{"observed_at":"2026-08-02T02:18:45.651355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-01T22:27:23.366415Z","title":"Dabstep: Data agent benchmark for multi-step reasoning.arXiv preprint arXiv:2506.23719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15766","last_updated":"2026-07-17T08:56:43Z","snapshot_observed_at":"2026-08-07T15:17:36.970238Z","submitted_at":"2026-07-17T08:56:43Z","title":"Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T22:27:23.366415Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.15766"},"observation_digest":"sha256:9a359afc3d481af4e2f3fe52ad4ae55d750076d7ec11cc4c4045b40abbfd2340","observation_id":"4841dbd9-2b56-4d6f-86b1-d410a2e6897b","resolution":{"observed_at":"2026-08-01T22:27:23.366415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-01T01:16:43.824531Z","title":"arXiv preprint arXiv:2506.23719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-06T22:52:32.781663Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:43.824531Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:d51bb549b8d21a78524546a006044f0838ecf626f80009e97d2f43cf94a1eb47","observation_id":"476bc867-a9d9-4d3b-afc6-a0fe2646229b","resolution":{"observed_at":"2026-08-01T01:16:43.824531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-07-30T22:55:11.426393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26724","last_updated":"2026-07-29T10:14:02Z","snapshot_observed_at":"2026-08-08T09:28:44.467335Z","submitted_at":"2026-07-29T10:14:02Z","title":"UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T22:55:11.426393Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.26724"},"observation_digest":"sha256:08dc3bde1ce92e97f6e893acdb6844fe764319ba536da6591e42eb53a633c53b","observation_id":"b9c22f85-25f8-41b1-8fae-261cc4c9ba4c","resolution":{"observed_at":"2026-07-30T22:55:11.426393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-07-31T19:54:08.368823Z","title":"Kingma, Leandro von Werra, and Thomas Wolf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28033","last_updated":"2026-07-30T11:17:27Z","snapshot_observed_at":"2026-08-05T02:42:56.093326Z","submitted_at":"2026-07-30T11:17:27Z","title":"DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T19:54:08.368823Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2607.28033"},"observation_digest":"sha256:484014cb54d091c33944efad76def165927c6f915ec5a50eb466cbf3acac2411","observation_id":"2b6306c8-17af-4a00-bd30-9d2331ff07a6","resolution":{"observed_at":"2026-07-31T19:54:08.368823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23719","snapshot_observed_at":"2026-08-10T04:39:03.430946Z","title":"Dabstep: Data agent benchmark for multi-step reasoning.arXiv preprint arXiv:2506.23719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07437","last_updated":"2026-08-07T17:22:00Z","snapshot_observed_at":"2026-08-10T04:33:17.039274Z","submitted_at":"2026-08-07T17:22:00Z","title":"Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T04:39:03.430946Z"},"links":{"cited_paper":"/paper/2506.23719","citing_paper":"/paper/2608.07437"},"observation_digest":"sha256:79334081a4ae7b4c1a7aa2c23978fc4c4d70630a241d392e9bbc57fb5786b73a","observation_id":"644faab7-ad14-4c37-b046-38a7b75ab743","resolution":{"observed_at":"2026-08-10T04:39:03.430946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23719/citation-record","integrity":"/paper/2506.23719/integrity","json":"/paper/2506.23719/citation-record.json","paper":"/paper/2506.23719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.275970Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"54f63029-ce98-45bb-b944-b8855239046f","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.333473Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:51394a60b0c20a85484c7a8370b5223246602785fcbd497309714aee4007b15d","observation_id":"4d315fcc-0848-49ac-96e1-6050c8eafbb1","resolution":{"observed_at":"2026-08-06T21:37:57.279909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.263108Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"4a8e2c4c-795b-49e1-a921-6aba4c6616bb","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.377890Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:e9b5ef8a95edbb5e37b241182d563757604dafa6a4250b7e19359435387a05ee","observation_id":"9c41d26e-68ac-488d-8c30-1c7a2a243d09","resolution":{"observed_at":"2026-08-06T21:37:57.267190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.250590Z","title":"Claude 3.5: Next-generation language models","venue":null,"work_id":"31e2a85c-df76-4e7a-8feb-e0858a62ddc5","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.463981Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:84632fb55a3761a76ee6705391876e560971e9133e3adb83d9ae319fade0d96c","observation_id":"53a705c0-6657-455f-819c-9013f35389f5","resolution":{"observed_at":"2026-08-06T21:37:57.254588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.237737Z","title":"Claude 3.7: Advancements in language understanding","venue":null,"work_id":"4312458c-fb76-4275-8f1c-89a672d96540","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.507926Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:091e453e3b1763acd7a0945bcaf54d7bc0273343fd9451a8bfb5c017eef4a92d","observation_id":"c216f380-c155-4219-a7c5-bb70cd4309b3","resolution":{"observed_at":"2026-08-06T21:37:57.241879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.224600Z","title":null,"venue":null,"work_id":"60cfc5cf-e4ec-46ad-ace7-8da30a930f46","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.590499Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:4dd3f9079b660cf6991630d1f876d7018d843c7331d658f4e12ce5e2e42b9b6b","observation_id":"13d8d062-c7cf-449e-bfc8-21c54f844013","resolution":{"observed_at":"2026-08-06T21:37:57.228911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-06T21:37:50.650169Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.650169Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:4d3fb022b5ddfeb2333d8508ecd9c04d2fc6819aef2869b7d5ff8b9c28208aa0","observation_id":"dbeba95d-0dd7-46bf-9482-91eef5049960","resolution":{"observed_at":"2026-08-06T21:37:50.650169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T21:37:50.711814Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.711814Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b72b0f43b8780f859521863e25ccbfa692c61c0f2e42e32c78c51d2ee23827da","observation_id":"5c594346-2d69-4e4f-a8d5-abcdcee3746b","resolution":{"observed_at":"2026-08-06T21:37:50.711814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T21:37:50.787132Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.787132Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:e35a8f6bf38b5f6c5607e88f31f52a3b8c900ec6758b1644966dd7ccbf83af4d","observation_id":"39c164cf-b273-49ef-92df-ad7218e1e9ff","resolution":{"observed_at":"2026-08-06T21:37:50.787132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.211969Z","title":"Laradji, Manuel Del Verme, Tom Marty, David Vazquez, Nicolas Chapados, and Alexandre Lacoste","venue":null,"work_id":"3569e0fe-f8f2-4961-89d5-b995075ea12b","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.852268Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:04c0506b9450148a9c4dc137a99164fcf0ac4725a1d435cd424b39b1bd6e6be4","observation_id":"be278e08-16aa-4dc6-8875-c0a78999081d","resolution":{"observed_at":"2026-08-06T21:37:57.215894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.197457Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"d684278c-34a0-4429-aa74-c4c7dbb100fe","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.943251Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:79362091206f4cb44ee266053bfdd66d5c609f24dc34369d89bab7d6dc804add","observation_id":"25d5083f-57c2-4d75-8493-b73cee719fda","resolution":{"observed_at":"2026-08-06T21:37:57.202284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:37:50.993213Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:50.993213Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:31f6e0bd84a59d8082cba9ceca1763185a0b97618706f2de398719cf0076294a","observation_id":"f42eff18-f0fa-41d3-80dc-ac02d16b4a38","resolution":{"observed_at":"2026-08-06T21:37:50.993213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:37:51.085757Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.085757Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b54e2197bfa36c0941e2e9326932b1d5b5fec285c0d2b01bb37455b18bc00db0","observation_id":"6923dfeb-86cc-480d-8a21-377f4f3458b5","resolution":{"observed_at":"2026-08-06T21:37:51.085757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.181581Z","title":"Text-to-SQL in the wild: A naturally-occurring dataset based on stack exchange data","venue":null,"work_id":"fc474569-0b57-41a1-bf76-606db3f7f448","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.166759Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:ac4b95d843a766a08d8fdec1ec85c63df2458dd4f9a829263fa1ac1678038288","observation_id":"efd09a51-46ec-42ea-b264-43336721becc","resolution":{"observed_at":"2026-08-06T21:37:57.186096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.167790Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"9e843797-9093-415e-9e54-16d196c4e129","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.238203Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:d2979fd2dec901374d3e15a02499f9218b1a6b60d48d64127d62e52059c7ee95","observation_id":"d60b1519-3c14-4765-a5db-57d57519602f","resolution":{"observed_at":"2026-08-06T21:37:57.172170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.153974Z","title":"InfiAgent-DABench: Evaluating agents on data analysis tasks","venue":null,"work_id":"2869d613-b49d-4c0e-af36-24e475d85126","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.368894Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:bd9c851baf2d78375d6f4009deb0384bae3e69bb203a8a6b50c290534c7d4387","observation_id":"3e367110-4d52-4d25-adb3-e8549ba96535","resolution":{"observed_at":"2026-08-06T21:37:57.158449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.140364Z","title":"Mlagentbench: evaluating language agents on machine learning experimentation","venue":null,"work_id":"81626455-c533-46b5-ae64-81be95d407fc","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.414910Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:98f183a09548c6d4b5406ad6f8109fc99b0a8e860c0206814d0873df1576ab6e","observation_id":"1977c770-4d5b-46ae-a20c-82fba8066dfc","resolution":{"observed_at":"2026-08-06T21:37:57.144688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.121923Z","title":"DA-code: Agent data science code generation benchmark for large language models","venue":null,"work_id":"456ce991-dd63-4cef-b2b9-b3584adaf95c","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.518323Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:7e3d8c9a89f846bdcc78c9510e6676bce7ba495fa7f2a490b43eda41b9a03a67","observation_id":"87af90cf-60bb-4edd-87e6-13c81dee47b3","resolution":{"observed_at":"2026-08-06T21:37:57.125954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.577389Z","title":"Financebench: A new benchmark for financial question answering, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.577389Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:366e3061e3afbeccdce327f4c4e963c129d610644ea3345bd0c9f80723e84bdc","observation_id":"e6b73b48-8231-49a3-9207-fffff11dea19","resolution":{"observed_at":"2026-08-06T21:37:51.577389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.695010Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.695010Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:c6e0d04f551611edd668a590191e6646655867b1ac768bc636064f037b00ef58","observation_id":"1ffd4f8f-cb5e-426f-814c-8932093f66a5","resolution":{"observed_at":"2026-08-06T21:37:51.695010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.089113Z","title":"DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representa- tions, 2025","venue":null,"work_id":"11343a81-77dd-466c-8706-5cce9d5007c0","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.782173Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:e63f3168e94a1d399e17784f16cd3b041387a740d641f8ff55f77408ae01fcbd","observation_id":"dad541e7-06b3-471f-85c6-5da7590a891b","resolution":{"observed_at":"2026-08-06T21:37:57.093190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:51.897687Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.897687Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:d011ea2442a592f58a8cc40f2a866b65b0ba231f0f67fe22480a1b4ddc130dc6","observation_id":"a3da2933-c194-4152-9803-8d353273e5cd","resolution":{"observed_at":"2026-08-06T21:37:51.897687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.065642Z","title":"KaggleDBQA: Realistic eval- uation of text-to-SQL parsers","venue":null,"work_id":"cf824325-a00e-450a-ba46-ad398c912ea9","year":2021},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:51.960292Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:99733b3f22e5d995615118318b11f110defc63d5e618e4e14e885a6107878b40","observation_id":"ccad99ba-4c64-4542-9986-c7e4cd043976","resolution":{"observed_at":"2026-08-06T21:37:57.069791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.051736Z","title":"Spider 2.0: Evaluating language models on real-world enterprise text-to-SQL workflows","venue":null,"work_id":"3dbd44af-0d51-4aae-ac3b-15ccf71772c8","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.035704Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:28e1344df29a300a9131cccfe5ccdf3e0f8caa9cdd5566a7514eae28609c5da5","observation_id":"ad14efe0-2847-4d41-90b9-c4c0929c0bac","resolution":{"observed_at":"2026-08-06T21:37:57.056301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.037391Z","title":"Can llm already serve as a database interface? a big benchmark for large-scale database-grounded text-to-sqls","venue":null,"work_id":"a6864141-0223-4d31-9334-430e2686f418","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.115929Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:2f7f879af56de047a8a36dbaa18a499030ffccb41d9fb5a9c02ab223699fcec1","observation_id":"f69aea46-4d3c-4d41-ad35-33788897ee2f","resolution":{"observed_at":"2026-08-06T21:37:57.042324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.023517Z","title":null,"venue":null,"work_id":"d508e13f-0db2-43f9-9549-38cccefeeffd","year":2018},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.185268Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:bd7d6ee4a86ee298cb79fadaa1fe88758dbbda94a4e036cf7f0281e688e2f659","observation_id":"88d65af3-85e1-4685-92c3-21a1cf1abceb","resolution":{"observed_at":"2026-08-06T21:37:57.027806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:37:52.243377Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.243377Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:1e1a64eb9b2798dd6532987f9a980d8d49b977a496d1622b93e9b1029c4b9b4b","observation_id":"19c53cf2-4f48-41f8-b39f-d0811b0c152a","resolution":{"observed_at":"2026-08-06T21:37:52.243377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:57.009855Z","title":"Agentbench: Evaluating LLMs as agents","venue":null,"work_id":"9555e0fc-b05f-4b2a-9050-97432a366058","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.323582Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:f5b4b732e9d42ec7ed0277c132122982bca14a5a3765804019a3e068298c8170","observation_id":"fa3a561c-799a-4c41-9755-3b739a34c96c","resolution":{"observed_at":"2026-08-06T21:37:57.013855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.996277Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":"bf5d5d14-e999-44fc-9da9-81c4e8032870","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.416043Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:e8fa74dc3d83ed89e44eef2896950cd8483b0d196be0ece255834cd304163285","observation_id":"f6874c40-368f-4d2e-a4bf-5b036e725406","resolution":{"observed_at":"2026-08-06T21:37:57.000512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.982460Z","title":"GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":"199aa7a5-119b-436e-ae4a-275f5e90651d","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.478008Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:8a384853ce2c234ad93cc1b085534c9ce95ff57c691296c628e6d154a90994dd","observation_id":"4ec8070a-dae3-43fa-add3-29b17f4fa92b","resolution":{"observed_at":"2026-08-06T21:37:56.986853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.968555Z","title":"Introducing gpt-4o: Multimodal capabilities and efficiency","venue":null,"work_id":"3a40589f-ca47-4759-a1cd-d31e356886e6","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.556221Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:ed92477cd4b871ffdbf278819c0799a0f1e347bc6f105f27805c28db4da4fd6f","observation_id":"f7bca586-d0ee-4c66-9e7c-3b1d8c93405e","resolution":{"observed_at":"2026-08-06T21:37:56.973080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.955711Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"e7fe11ef-fb99-4c74-97c7-79fcc8228a8d","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.644866Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:eac6d44f369107230592aa7a2af1b94791399872a4dbca2fa6a648d14b8568b9","observation_id":"78f6950f-26f5-47ab-929c-f87abf9397ac","resolution":{"observed_at":"2026-08-06T21:37:56.959752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.942498Z","title":"Openai o1 and new tools for developers","venue":null,"work_id":"eb8ce1df-8d82-404a-a0eb-20ab022c087a","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.711930Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b43aa2348fae7be713c9070536329e4efeb0b0194101f36cb532794a28fb5224","observation_id":"73e40c86-e70f-4a96-82ba-d258d2dd2bcd","resolution":{"observed_at":"2026-08-06T21:37:56.947052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.929276Z","title":"Gpt-4.1 technical overview","venue":null,"work_id":"10dc6061-9275-40b0-b03c-99089604aff0","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.775886Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:a5068f446a69ac2936875173c325b1a7ffc7510e38dedea316cf699e67d566fc","observation_id":"cfc5149b-3e5c-420a-8654-26d83a5f34dc","resolution":{"observed_at":"2026-08-06T21:37:56.933192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.756238Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"ca040304-3212-4f74-b389-00be28425751","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.865165Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:7af40fa8c30231303635668064c69bb8005179de72a3a3a11d490d5f4bb995bc","observation_id":"517e6610-118a-4502-bf78-2fbe3128c30b","resolution":{"observed_at":"2026-08-06T21:37:56.841094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01395","last_updated":"2019-05-04T00:27:22Z","snapshot_observed_at":"2026-07-06T07:50:18.818939Z","submitted_at":"2019-05-04T00:27:22Z","title":"On the Difficulty of Evaluating Baselines: A Study on Recommender Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.01395","snapshot_observed_at":"2026-08-06T21:37:52.935613Z","title":"On the difficulty of evaluating baselines: A study on recommender systems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:52.935613Z"},"links":{"cited_paper":"/paper/1905.01395","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:53f539d9365da08cbbbe414707a09f560deb90dec083ff415f3e3322b942919a","observation_id":"399e59f8-ea89-421d-b6e7-504fe3faaa0b","resolution":{"observed_at":"2026-08-06T21:37:52.935613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.522519Z","title":"smolagents: A smol library to build great agentic systems, 2025","venue":null,"work_id":"1e2f8e22-7836-4c08-9ac3-2587c3d382c5","year":2025},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.007256Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:8435ef8dda76d4bcad54c18210b5086d39e1164bcaef06bd3eadf5e0cc2f2a37","observation_id":"fd058908-c099-4d70-abbe-6dbc1cf6f90c","resolution":{"observed_at":"2026-08-06T21:37:56.721918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.307662Z","title":"Let me speak freely? a study on the impact of format restrictions on large language model performance","venue":null,"work_id":"ff92221e-3e47-4408-9176-0cfc16fe6652","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.112099Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:209e406d2ec0ed409ee6580c152fdbecfcc1788a2ac9f628fc9c3bc4f99c7b39","observation_id":"430eae7b-a90d-4ab3-828a-8f9fa0b44d0e","resolution":{"observed_at":"2026-08-06T21:37:56.346199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.206485Z","title":"Attention is all you need","venue":null,"work_id":"635e85d3-b1de-476e-92c6-63debd7a2a2a","year":2017},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.182266Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:31d760599069a8b3bff8883e52243659501d3a107f380095ed99029147af0d61","observation_id":"224fe5b7-773b-43ce-b753-7d3f9b33d125","resolution":{"observed_at":"2026-08-06T21:37:56.272722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:56.072228Z","title":null,"venue":null,"work_id":"66b02f67-8b49-48a8-bbe8-a3c3d11b2285","year":2019},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.266303Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:f9ad66653c2e5955978749e1af6cdd71480794ad9ad7550e2d8edb0e541b2a1b","observation_id":"2ad18714-dea3-48c9-9525-941ad833c1ce","resolution":{"observed_at":"2026-08-06T21:37:56.144291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.901331Z","title":"Text-to-sql generation for question answering on electronic medical records","venue":null,"work_id":"5e7f9e5f-d9c1-4f5b-9ac6-1cc925b67291","year":2020},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.317720Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:00deb005a0463e5902bd97686aa1da1434916b4f01bcfb6cdccc45b178deda0d","observation_id":"9d799cd1-a372-4fb0-ab24-903b849b45f2","resolution":{"observed_at":"2026-08-06T21:37:55.993395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.715900Z","title":"Won- derbread: A benchmark for evaluating multimodal foundation models on business process management tasks","venue":null,"work_id":"c6811102-1bca-425b-b77d-6652d00e98b2","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.399064Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:5a39b15700f2dd5f9891cd9c6f70770e3861a354bd830acb56ff2f3d088e0a13","observation_id":"44fab7f5-6366-4e6f-a27a-ae3086d26246","resolution":{"observed_at":"2026-08-06T21:37:55.792634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.500100Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"c7cb0844-811b-4a83-ba4a-ada1ecf5d95d","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.476819Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:029d6946ab51603e1e9d3c124b73998e12b88562765a78b3000470bdda025d89","observation_id":"9b3f0674-ec5c-47d2-a125-bb7ff1a64c01","resolution":{"observed_at":"2026-08-06T21:37:55.585395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-06T21:37:53.510368Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal behaviors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.510368Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:b64258036258bd28af13db6a79917307f4dfbe2fc21bfea8bd095aa233455432","observation_id":"1349b8da-5657-4278-9702-4815ef78a55e","resolution":{"observed_at":"2026-08-06T21:37:53.510368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.278565Z","title":"Intercode: Standard- izing and benchmarking interactive coding with execution feedback","venue":null,"work_id":"a797d9e1-9005-47b1-b974-41aed817b994","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.621416Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:6a736a75191f832044d236248dd6c7f06c16e7e7d32ac01bef4d14e91f868c39","observation_id":"d2b9a81d-d68c-4d9f-8bd1-90d789826100","resolution":{"observed_at":"2026-08-06T21:37:55.392738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:53.686043Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.686043Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:a0d46a2d0c244e9cf960b83a534406a030e862123aa35350fe304b7079025072","observation_id":"c985aa84-40ad-4478-ac04-5495149a8b6e","resolution":{"observed_at":"2026-08-06T21:37:53.686043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:55.034926Z","title":"Natural language to code generation in interactive data science notebooks","venue":null,"work_id":"153d4e91-f5c0-43b7-be0e-dc21895a9248","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.758304Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:7197536e9b197fc40e33a448a91ce15067de757c716c753d63b9db1901f8df31","observation_id":"5d723746-67cf-4626-afb7-cda7350050d1","resolution":{"observed_at":"2026-08-06T21:37:55.209547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.855400Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":"a24a128f-4528-4bc2-9d9b-dcac86d0776b","year":2018},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.855369Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:6034eee2e14606031678ed05b641a5158ca04e6335d8907e3075c2a0da3eaa48","observation_id":"77c023b4-86c9-4cae-9759-955d778af1a0","resolution":{"observed_at":"2026-08-06T21:37:54.982137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.673663Z","title":"Benchmarking data science agents","venue":null,"work_id":"f164e270-80ed-4523-8378-d4800cbcdb80","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:53.940982Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:05cf81be976610529d126b2e3fee2b109a2e53f1353d4b960f2f5ab54135349c","observation_id":"4a5446d4-801b-45d5-87c1-bca8f374a499","resolution":{"observed_at":"2026-08-06T21:37:54.784644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.541083Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena","venue":null,"work_id":"72db1eb4-1176-413c-a1a9-74c4ab5d37ae","year":2023},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.029828Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:ae9ea2df096973c2d9616551c433f373847e32527998cf24f80931ba7b1aa070","observation_id":"ba97e827-8b90-41de-ad74-e8d97748cfce","resolution":{"observed_at":"2026-08-06T21:37:54.596063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-06T21:37:54.118777Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.118777Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:979414ac3614e8831abc9946f63ccaacbefcdc3e9263dfdda8c95fd7e34ae6b2","observation_id":"1a061464-ef55-4cea-8158-caa7e362e69a","resolution":{"observed_at":"2026-08-06T21:37:54.118777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:54.404843Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":"552642d9-7861-48e3-a233-dbfd66e6fc70","year":2024},"citing_paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:54.197640Z"},"links":{"citing_paper":"/paper/2506.23719"},"observation_digest":"sha256:bd20f13914c08f68b127f17e74166f0807283617d7c2090f41d008095544335c","observation_id":"9c3f61fc-2d65-4c4c-9e34-3b2b93ff5e2a","resolution":{"observed_at":"2026-08-06T21:37:54.462473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23719","last_updated":"2025-06-30T10:49:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:19:06.596628Z","submitted_at":"2025-06-30T10:49:21Z","title":"DABstep: Data Agent Benchmark for Multi-step Reasoning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 21 inbound Pith citation observations for arXiv:2506.23719."}