{"as_of":"2026-08-20T13:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60f2ac0d90dc111ae1e23a4b1a85d5b6d20676bc6138a0f5bdb3aa41e1200f4c","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:56.334492Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:39:03.476630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2605.03808","last_updated":"2026-05-05T14:35:47Z","snapshot_observed_at":"2026-08-15T04:58:20.105540Z","submitted_at":"2026-05-05T14:35:47Z","title":"Agentic-imodels: Evolving agentic interpretability tools via autoresearch","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:43.371592Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2605.03808"},"observation_digest":"sha256:fb7a28a47a0c8727a1fef4b85db0a9c1dd252df0f17ddcaf452355ff9fb47276","observation_id":"9a5ed600-2958-4aec-8a75-ad0184b222c7","resolution":{"observed_at":"2026-05-11T23:36:36.195393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2606.00051","last_updated":"2026-05-08T08:23:10Z","snapshot_observed_at":"2026-08-07T00:25:09.123345Z","submitted_at":"2026-05-08T08:23:10Z","title":"Business Utility of Large Language Models as Exploratory Data Analysis Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:17.416071Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2606.00051"},"observation_digest":"sha256:53ad3adcc855b284a1bb2fa2dc7bf6ffefdd73b03ae6979466b47a1f4b369a09","observation_id":"bac24401-0195-4260-9e1c-0f3adccc3009","resolution":{"observed_at":"2026-06-30T23:35:06.971550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":"2505.18223","doi":"10.48550/arxiv.2505.18223","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis","venue":"arXiv (Cornell University)","work_id":"12352b65-81bf-4214-b91b-9cbad5d7d5a6","year":2025},"citing_paper":{"arxiv_id":"2606.16000","last_updated":"2026-06-16T21:25:39Z","snapshot_observed_at":"2026-08-02T17:38:04.521168Z","submitted_at":"2026-06-14T19:58:06Z","title":"GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T03:42:40.528376Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2606.16000"},"observation_digest":"sha256:0a2f5a3485969d1e511b1599cbdb86369a0fa85c7c5d0bc3380e4f5fc8d98106","observation_id":"df93a095-2e57-43a7-984e-0232a0767299","resolution":{"observed_at":"2026-07-03T17:48:46.135475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-04T02:02:25.908482Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.908482Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:2a7a7f86d7d7b9d8f7189082de7cee8aaeb293c08733d319349595da1ed1c35d","observation_id":"9a5bb880-d645-4644-bb41-fec033f6c5fa","resolution":{"observed_at":"2026-08-04T02:02:25.908482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-10T04:39:03.476630Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis.arXiv preprint arXiv:2505.18223, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07437","last_updated":"2026-08-07T17:22:00Z","snapshot_observed_at":"2026-08-19T17:32:10.055324Z","submitted_at":"2026-08-07T17:22:00Z","title":"Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T04:39:03.476630Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2608.07437"},"observation_digest":"sha256:4b61c3a049a75969258e1335a44dd19d90880c50fa902226893aa13c70d618c4","observation_id":"8837324d-564e-4c35-8c3a-42f6175dc1af","resolution":{"observed_at":"2026-08-10T04:39:03.476630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18223/citation-record","integrity":"/paper/2505.18223/integrity","json":"/paper/2505.18223/citation-record.json","paper":"/paper/2505.18223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.375570Z","title":"https://openai.com/chatgpt/overview/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.375570Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9128a20d6147be79eed80843befacff599e4f9797a3a27dad57eb510621a0910","observation_id":"ecc08bef-6e53-407b-90a6-bd6714fc6d3b","resolution":{"observed_at":"2026-08-07T14:46:47.375570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.422036Z","title":"https://kdigo.org/guidelines/ ckd-evaluation-and-management/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.422036Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7186b24cfa4671129ae2087460694146a1775956acf08f78985a0951100f1afb","observation_id":"a41767eb-7ca6-4088-954c-269d6eab8387","resolution":{"observed_at":"2026-08-07T14:46:47.422036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.538518Z","title":"https://claude.ai/login?returnTo=%2F%3F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.538518Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:261405e7de7a9b006da6a4130dfbe04d7ca1d9824dd67cfdaa25b9deced8492d","observation_id":"0ec5e043-740e-41ab-8cc8-d2b9a2160b9a","resolution":{"observed_at":"2026-08-07T14:46:47.538518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.644511Z","title":"https://www.deepseek.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.644511Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:61a15fa7087c930738480df099f5ab2499fe2adb7699e9914692cede3a04e847","observation_id":"ed4e1285-fefe-4e8d-b6e1-3edd4299a2fd","resolution":{"observed_at":"2026-08-07T14:46:47.644511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.751152Z","title":"https:// playwright.dev/python/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.751152Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:f008f7a6a4e890ace061e3f295df5d5da9f7d93c0a7efe880fc8de4e8e403565","observation_id":"17dcf292-639c-4df1-92b5-313b86dbeed5","resolution":{"observed_at":"2026-08-07T14:46:47.751152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.835901Z","title":"https://gemini.google.com/app","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.835901Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7e18fc68e070844aa55acdd3810f8c527597cd8c4f87b34ed94557c3178355e5","observation_id":"12090ef0-2de9-4b51-96f1-f07cf0f1200c","resolution":{"observed_at":"2026-08-07T14:46:47.835901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:47.906553Z","title":"https://grok.com/?ref=findaitools","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:47.906553Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c88722a51f2472d877faaa29668efd863a92a71f3a547a3579625f1f18f581f3","observation_id":"77e27f61-5a20-4d86-9a52-6596c68fba6f","resolution":{"observed_at":"2026-08-07T14:46:47.906553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.019029Z","title":"https://openai.com/index/ improvements-to-data-analysis-in-chatgpt/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.019029Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0665a95dcc1514ba12f6eb588cca1ee3b74656b3ffb08c9f641fd17100adfaf3","observation_id":"fd3e7bcf-80ca-424c-b9ed-081d2689aa73","resolution":{"observed_at":"2026-08-07T14:46:48.019029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.103552Z","title":"https://www.anthropic.com/news/ analysis-tool","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.103552Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ee137745e780255f96441732f13330189c94467fa316614708abd0a2beda984b","observation_id":"fcae7a13-e180-435e-b35e-8df02835c009","resolution":{"observed_at":"2026-08-07T14:46:48.103552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.197118Z","title":"https://github.com/ jupyterlab/jupyter-ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.197118Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6da50f4cf1a05873545b275b84b58688defc9cd633a92df64616be86acb78a41","observation_id":"8e32d172-f5d9-4b65-9f9e-b1af06aa87a9","resolution":{"observed_at":"2026-08-07T14:46:48.197118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.280980Z","title":"https://www.kaggle.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.280980Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b96aa2c9adea400edd1b9375b64f3c31a98218ccb80d70709034376a0f9d804a","observation_id":"17cef869-52e8-44ac-818f-818f24ec8b60","resolution":{"observed_at":"2026-08-07T14:46:48.280980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.354070Z","title":"https://docs.litellm.ai/docs/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.354070Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4c21efe18eedd7675a5b419bacdce5c646f7f28b4f2b7bd0c75f1800e2234635","observation_id":"220e6105-e3d3-44f4-a087-ef6266520e49","resolution":{"observed_at":"2026-08-07T14:46:48.354070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.461121Z","title":"https://www.llama.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.461121Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7a97feb2d63d9b647f3e0e75a8540de54252fd454813a72d38e8b1e0bf87e914","observation_id":"b327b415-f453-4565-a74a-c816d7cf279e","resolution":{"observed_at":"2026-08-07T14:46:48.461121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.539289Z","title":"https://corporatefinanceinstitute.com/ resources/financial-modeling/modeloff-guide/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.539289Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0fff0d0464974271a1503ef44dd45ee1b6eb93b36f3ca2ae300907c12ddb01ac","observation_id":"e1af57cb-18b0-401e-bcf5-60318fa7072a","resolution":{"observed_at":"2026-08-07T14:46:48.539289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.624374Z","title":"https://openai.com/index/ o3-o4-mini-system-card/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.624374Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:a8c66c30e124653303fe2fa689c463dcc09bb87522787a4d7817746f4c97dc01","observation_id":"f29a29f3-9504-43be-b4fe-f2acdad40c95","resolution":{"observed_at":"2026-08-07T14:46:48.624374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.716807Z","title":"https://kaggle.com/code/alexisbcook/titanic-tutorial","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.716807Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1050448d5f090dcf23307f2f9b7b940cb3441bef325a416c4f23092fdf3f26d7","observation_id":"55ecbb75-05d9-4bc2-a787-3e58880c994e","resolution":{"observed_at":"2026-08-07T14:46:48.716807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.823526Z","title":"https://www.vectara.com/blog/ deepseek-r1-hallucinates-more-than-deepseek-v3 , January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.823526Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:76f85907b47da463d6496f8a45f860d80fe8fab8dbf53df7ab8b6d0519f07e7d","observation_id":"4687eb9c-b3e6-4030-8e45-1afd5713a692","resolution":{"observed_at":"2026-08-07T14:46:48.823526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:48.901910Z","title":"Open Interpreter, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:48.901910Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:2d61448195f2a5344874c4f9a602bce34e917aa48c827a8ff8eb191fe8c6d8d0","observation_id":"a698d4cf-d334-407d-af67-bf19a9a02aef","resolution":{"observed_at":"2026-08-07T14:46:48.901910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.002506Z","title":"Wang, Ruoxi Sun, Pengcheng Yin, Caiming Xiong, Ansong Ni, Qian Liu, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.002506Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0b87329c2feee432e4bb9a6863843c94f1f7b23b35c4ae446251df95f3c926a3","observation_id":"07a9dd83-13f9-4c37-9576-b59a4c52162f","resolution":{"observed_at":"2026-08-07T14:46:49.002506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.146885Z","title":"Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.146885Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:51fca2f8f6a5f0933e40fa184fc13e9f5d455e701344e5821b34251edc54e8f2","observation_id":"8ad22ae2-09e4-42c1-aab4-d0d2f5cb6386","resolution":{"observed_at":"2026-08-07T14:46:49.146885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.237419Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.237419Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9b08dbcb32244e5118e28ca799cbeb2465bd3fe6937f113dfc8e721b1280200c","observation_id":"2e918e4a-0b65-44f3-9b62-c41910c0a583","resolution":{"observed_at":"2026-08-07T14:46:49.237419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.345478Z","title":"Early Childhood Behavioral Inhibition and Social and School Adjustment in Chinese Children: A 5-Year Longitudinal Study","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.345478Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:f9cef92c4d10d9dade9e529d3932c2d166b74335392375bdb2eec0efd392386e","observation_id":"df06d733-c902-43df-9227-a54d2731aed1","resolution":{"observed_at":"2026-08-07T14:46:49.345478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.442113Z","title":"Behavioral Inhibition in Early Childhood and Adjustment in Late Adolescence in China.Child Development, 92(3):994–1010, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.442113Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8df4de0d6b6aaee94be79987b7a706091b711e87e5a65b3c60cc700b58365a91","observation_id":"eca5cf31-f3d9-4976-a35d-880601388019","resolution":{"observed_at":"2026-08-07T14:46:49.442113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.506686Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.506686Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:148c1b4b1207750c9299e99f04cc49c2f191a17f98598c71c1790aeab8d9cef1","observation_id":"5c903be9-bd00-43ea-b1e0-4fbf847208b4","resolution":{"observed_at":"2026-08-07T14:46:49.506686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.644779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.644779Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:60317c846a39363542d752a0190c77d098573000619c5127d10f37ddec957928","observation_id":"87564adc-cdd4-4ac4-bdad-8f60b51a973e","resolution":{"observed_at":"2026-08-07T14:46:49.644779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.774028Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.774028Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b566e74b0a3ef5a581f0945898f049fa763b93d156ea517494475efb92340113","observation_id":"1e3b15ee-293c-4733-b6e3-4af49fde5232","resolution":{"observed_at":"2026-08-07T14:46:49.774028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:49.890873Z","title":"MIND2WEB: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.890873Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:17b056352e080b7320d58ced9ea2b7c645fcfa9f0adb36ae0d15883deb6696f3","observation_id":"9ead89f3-e925-4acf-8c66-4ffe2717f0da","resolution":{"observed_at":"2026-08-07T14:46:49.890873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.005144Z","title":"Zhang, Lanyi Zhu, Mike A Merrill, Jeffrey Heer, and Tim Althoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.005144Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:65604571b52a3ef8fbbf80a29aeff1fc27a2fc2382ee14910409a4760914489e","observation_id":"2fe20fad-f943-4737-bda9-c6edd4795ac7","resolution":{"observed_at":"2026-08-07T14:46:50.005144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.104495Z","title":"ConvCodeWorld: Bench- marking Conversational Code Generation in Reproducible Feedback Environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.104495Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b7f0d175c9c206e3b01a59a55957b0db35176bbbcaefc3cc10152903d5d8999a","observation_id":"067149e5-a82c-4071-bb41-2f4c2f1f42f7","resolution":{"observed_at":"2026-08-07T14:46:50.104495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.185494Z","title":"InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.185494Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:428094c59827396123da9634ff539aae3bc18df992d717df7936da63d48bd586","observation_id":"60934f52-c90c-4d92-92cc-cf81c547b73b","resolution":{"observed_at":"2026-08-07T14:46:50.185494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.278411Z","title":"MLAgentBench: Evaluating language agents on machine learning experimentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.278411Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8d3fa1e1dbbd94fd2cc4c2ba5f44dabf31391506d13fee3b053a99ebfeb5ba80","observation_id":"d5ed60d4-38f9-460b-b43b-87f2e4bb42fa","resolution":{"observed_at":"2026-08-07T14:46:50.278411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.397300Z","title":"SimulBench: Evaluating Language Models with Creative Simulation Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.397300Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:64c645171bc7135104d16be283b58f064cf52fa1fd399a629e2aaa14a47385ec","observation_id":"00c6d552-a65e-4b11-b0d8-dd904dcedb00","resolution":{"observed_at":"2026-08-07T14:46:50.397300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.501633Z","title":"Taylor, and Dan Roth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.501633Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bbc06f7fad27b014b4655c4425be72b74ae79bbab84f0ce540223d545a102381","observation_id":"73a77602-0ddb-4a60-8045-dc76370cd9e9","resolution":{"observed_at":"2026-08-07T14:46:50.501633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.600200Z","title":"AIDE: AI-Driven Exploration in the Space of Code, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.600200Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0c4c9e40a7a44c9277d0bfe1afe4eb6f742f08a78c07669b1dcde18800b20fcc","observation_id":"df4daca1-9a70-4436-ba7a-c4b4b2c4e9f8","resolution":{"observed_at":"2026-08-07T14:46:50.600200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.674757Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.674757Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:83149e667bec75e223dc0815a0b3ed95cf07d104c4fa65c6b01fd7425b51514a","observation_id":"55507d96-4c19-4e77-9c5e-00ed4191bdb0","resolution":{"observed_at":"2026-08-07T14:46:50.674757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.748889Z","title":"DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? In The Thirteenth International Conference on Learning Representations, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.748889Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9b213dcec50d80816f9a141900797d7f2734cd1846ae7f2b490faab61b89ec67","observation_id":"85873741-2204-46ab-8cf8-1ba307bdc009","resolution":{"observed_at":"2026-08-07T14:46:50.748889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.824763Z","title":"LLMs Get Lost In Multi-Turn Conversation, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.824763Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5ed7d60082a5addcbdb14cf52378cee05698d4a3098257b71870acab8624e430","observation_id":"9b0cbea0-f729-4ed9-b56d-f03645362316","resolution":{"observed_at":"2026-08-07T14:46:50.824763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:50.906565Z","title":"DS-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:50.906565Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:6ad4b177af93d75a6e829afa2ec50133f5625e76c319565cdd296fc321f4a110","observation_id":"a1199356-618e-42fd-bdfc-e50642333817","resolution":{"observed_at":"2026-08-07T14:46:50.906565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.006372Z","title":"Leonard, Nathan Kuppermann, Cody Olsen, Lynn Babcock-Cimpello, Kathleen Brown, Prashant Mahajan, Kathleen M","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.006372Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:f895171f35e911de03480685cc1137d2a7332aee0fd53f27bbf222fceb0a3db6","observation_id":"5f43f6a3-b435-41d4-8e79-db623e2813f6","resolution":{"observed_at":"2026-08-07T14:46:51.006372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.093050Z","title":"Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis Agents, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.093050Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ddc91228675a111cf8aa027b9c1f1ac65f6f16d8394c5054f7f1524b53e8cd44","observation_id":"ed27d3d4-fbaa-41c4-be84-3ad53b669655","resolution":{"observed_at":"2026-08-07T14:46:51.093050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.229090Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.229090Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:38d9164281acf258744a7db3bc046a8a5c5b18541e5db9048285d44e08666848","observation_id":"2c76353b-32fe-49dc-a1f9-af89600519a1","resolution":{"observed_at":"2026-08-07T14:46:51.229090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.348204Z","title":"Nigrovic, Alexander J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.348204Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:1256d800e13248f10fd5a85c03ae53e47692f96196b4bf0d94e75162df9aef36","observation_id":"1c0c93ff-7d7d-4af5-9ab0-2ac602e76c00","resolution":{"observed_at":"2026-08-07T14:46:51.348204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.447780Z","title":"Missing Women and the Price of Tea in China: The Effect of Sex-Specific Earnings on Sex Imbalance","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.447780Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c911e7ce8df8c77b23648ad5c89342cc0e031be7adbc05034f399cf8b52f8d5c","observation_id":"4b1a4f80-c4f0-4818-84fc-50219cf352ac","resolution":{"observed_at":"2026-08-07T14:46:51.447780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.529329Z","title":"Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Kenji Toyama, Robert James Berry, Divya Tyamagundlu, Timothy P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.529329Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:8594535118e4a010bff661cb6ae919c1d083e923094902e3f3e63c8975d36b5f","observation_id":"bcdc709e-79db-4d47-9f3f-95d223eb86eb","resolution":{"observed_at":"2026-08-07T14:46:51.529329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.643489Z","title":"AutoGPT, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.643489Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:60cac5d43d468e9559db61922427bb32b82d8e2902aaae6d609082730367b53a","observation_id":"73ec0527-2e98-4d3a-97f3-eaa7ef0d0496","resolution":{"observed_at":"2026-08-07T14:46:51.643489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.738296Z","title":"Increasing Trans- parency Through a Multiverse Analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.738296Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:615d3f193a6a274bfa6f0c5ca2a4400025a015b3d34202b5b1f8b574d78d8e17","observation_id":"ef18b500-757c-4525-931c-0ac560ad1db1","resolution":{"observed_at":"2026-08-07T14:46:51.738296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.858250Z","title":"Sullivan, Wanze Xie, Stefania Conte, John E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.858250Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bc486f0489782fc39bbd21bcfd9838731db8a7826b0f89772f67e144a33845d5","observation_id":"198f234e-32b0-4d2d-ab5b-39686a365605","resolution":{"observed_at":"2026-08-07T14:46:51.858250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:51.942137Z","title":"A macroscope in the redwoods","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:51.942137Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7ef7eb97402e4d1a05ecd6e5d9222f6863f26e525a8c3de120ef1f58d742c022","observation_id":"3e7f517e-40f4-49a4-ae03-559ae0e85d12","resolution":{"observed_at":"2026-08-07T14:46:51.942137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.023348Z","title":"Meeseeks: An Iterative Benchmark Evaluating LLMs Multi-Turn Instruction- Following Ability, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.023348Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:603ea1dcb6d1e5045231e0a2b00b4fbc29cee9923970771b03c933066f14ce08","observation_id":"b0f11a23-7418-481d-91f1-20ccdb91cd60","resolution":{"observed_at":"2026-08-07T14:46:52.023348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.114734Z","title":"CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.114734Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4af34d821a9686ded9f77540cfe0f5c29dac99bf37ec2ceb12c4733d61fc2d86","observation_id":"30c605ce-766a-424f-80b7-25f95ad3fa4b","resolution":{"observed_at":"2026-08-07T14:46:52.114734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.198472Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.198472Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:b960e631b0ae28213a0d4aab59b763085b29c0c910876b1fdcecec18c251bbf8","observation_id":"8a4f9766-4b2d-4c38-b962-8fed31bcdae1","resolution":{"observed_at":"2026-08-07T14:46:52.198472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.286596Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.286596Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:94c8928d3508fd67dc4bdde4d6b8b5d0fe3ab4409a489d462d1e3b5918e704bd","observation_id":"5987d22d-b5c8-4ae0-ad9c-57b282e34dbf","resolution":{"observed_at":"2026-08-07T14:46:52.286596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.403469Z","title":"InterCode: Standardizing and benchmarking interactive coding with execution feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.403469Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:20e418ad7d64df18cbe44bc8e8a3b6fb6705384e3c6b522c780ea20a487e8365","observation_id":"294be3d0-06e5-4202-8929-1cbdf00938eb","resolution":{"observed_at":"2026-08-07T14:46:52.403469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.503874Z","title":"Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.503874Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:d38e51a2658a71163d327f2e66c817a17b273726ef357394e9458afc640c4b3a","observation_id":"19e12766-6598-4602-8ab0-9bc7d65ded46","resolution":{"observed_at":"2026-08-07T14:46:52.503874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.612890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.612890Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5e7b6e97b9a9e627d8e6ff78539c0cf5d716c27acfe80d8bc3e17d3ecacd8310","observation_id":"8148cacd-91a5-4586-aa76-da92dcbe8311","resolution":{"observed_at":"2026-08-07T14:46:52.612890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.694797Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.694797Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:78bc2ca69948f1ddf9b3d1121815fe973ba74996b0dbed4ab6487c6d8367df41","observation_id":"6a4904fb-7fca-4e45-9db5-b539db6374c3","resolution":{"observed_at":"2026-08-07T14:46:52.694797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.802633Z","title":"Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.802633Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bcc7623d2b3c0125d04a045812eabdf41f17d542b88bd0e6f539f087344d2648","observation_id":"4b4f32a7-31a7-4744-bce7-7c995da0c51b","resolution":{"observed_at":"2026-08-07T14:46:52.802633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:52.895292Z","title":"Benchmarking Data Science Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:52.895292Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9a1bbff2989d5467729419dce31e620d545c70134b92155267d3b984d17bb6fc","observation_id":"5e4f68f8-7906-4b43-8340-c8a768d3462f","resolution":{"observed_at":"2026-08-07T14:46:52.895292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.012811Z","title":"Decision Company","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.012811Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:edcec05a9cff2f7cbbc54a87e2e9f297f7f69aa20b1990e586e3efca97a6a110","observation_id":"d62c35ab-2a66-4820-a555-1998df3afb02","resolution":{"observed_at":"2026-08-07T14:46:53.012811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.058249Z","title":"- Before taking consequential actions that update the dataset, list the action details and obtain explicit user confirmation (yes) to proceed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.058249Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:a845a5652643557a6536dfaf9c564d6011a49358f45b1b1219bf06ce63ef51e5","observation_id":"356f18bc-fadf-4c13-bec4-a7172f015410","resolution":{"observed_at":"2026-08-07T14:46:53.058249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.129886Z","title":"- Output: Use print() exclusively -- no but no other methods (e.g., plt.show(), returns)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.129886Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:26a29980b28042e5428fd91ac4d313d1db9f8fa30c89aa00832c42b14ec2fa77","observation_id":"6819f32e-4dc1-4839-9183-084ef4b1f2e6","resolution":{"observed_at":"2026-08-07T14:46:53.129886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:46:53.208871Z","title":"- Adding analysis beyond the requested task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.208871Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7e1a835a8d5458aa942056cd528cb3e4fbc8d43b6c82ff055e8e559aa75e0edc","observation_id":"4911b584-05ff-4b84-ae10-f91610a2d0e4","resolution":{"observed_at":"2026-08-07T14:46:53.208871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:15.278460Z","title":"The user has given you full permission to execute any code necessary to complete the task","venue":null,"work_id":"5566adce-a3f7-4d1a-b6c9-246403edbc2c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.289214Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:be49b76fdf699096163a753834faed74806f24c6c68f4bbdf648912fed1cb51c","observation_id":"eefe7998-fe8e-4f12-b1ca-ba53432410a1","resolution":{"observed_at":"2026-08-07T14:47:15.354088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:15.147634Z","title":"guardian","venue":null,"work_id":"17b36131-22ce-4c4f-815c-e1137f8d78c8","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.350669Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ff265d5be696999aeb2fbb2619f387505ce089bbeb32c64e26338281e5d31379","observation_id":"c95f9d02-1841-4e00-ba1b-1acacb25a166","resolution":{"observed_at":"2026-08-07T14:47:15.197973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.963389Z","title":null,"venue":null,"work_id":"fd0ba692-9308-481c-9f1a-0520740adf7e","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.432085Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:26e73ec382343d294170c453ad6edf5f7a5bb109777bdf73af768c6c543118af","observation_id":"b3942cd9-059d-4da6-88ae-4049c85a5310","resolution":{"observed_at":"2026-08-07T14:47:15.055000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.760129Z","title":null,"venue":null,"work_id":"77f155a4-26d5-4c5c-baa6-f190dfd87131","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.507249Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:577cefb122798b3b1ad9338b28d5049332e3380157c3add0305125130fb3ec16","observation_id":"0b1cde42-b2f0-4c08-9dbf-e4f9a4c1614c","resolution":{"observed_at":"2026-08-07T14:47:14.884560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.591276Z","title":"thought\": <the reasoning process of the gatekeeper>","venue":null,"work_id":"d999b516-0b24-4321-b5f8-019d69be251f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.617722Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:0328dbf71a9190dd41161570d11ccde8689334fa802751342fa4b2ec75ad0001","observation_id":"9f9fd221-fe99-4e1b-ba9d-f6a10dd73f03","resolution":{"observed_at":"2026-08-07T14:47:14.662236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.411523Z","title":null,"venue":null,"work_id":"dd06ce26-165f-49fb-a104-3ae53e175ece","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.700268Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:7084067bcec2f010fe8710bd531043085582fec4970c4725ccf7d7e70657e8fd","observation_id":"5b0bf50f-dd18-45ff-a0b3-ecbadae7a6ed","resolution":{"observed_at":"2026-08-07T14:47:14.510799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.246041Z","title":null,"venue":null,"work_id":"00a26332-a95c-424b-aa9e-e0ab53ea0cb1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.779862Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:17af246d270fe0c61af08a0a2caa9b70cb864299a50755840dd9a2e15b14d077","observation_id":"9ecef980-519c-420c-8b61-72bc50a6aab4","resolution":{"observed_at":"2026-08-07T14:47:14.332655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:14.097903Z","title":null,"venue":null,"work_id":"6edb3d51-bca3-45a7-be18-0318ba0ab11b","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.867111Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:442776ef546b7d43df8d59d129cf11f7aa44e1e6ca571380767a3ac66ceed92d","observation_id":"d2cbaf3f-d01f-4685-8765-34bd666e477b","resolution":{"observed_at":"2026-08-07T14:47:14.170602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.909455Z","title":null,"venue":null,"work_id":"7fe0199b-f9e0-4843-87ee-f047d8c2a0cb","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:53.958532Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3ae6784fee96223f44c69212a5c4010af5c47ed1c73ec9f9107f60254b35acb7","observation_id":"f798acac-d199-4eaf-8436-5a45dfc08f4b","resolution":{"observed_at":"2026-08-07T14:47:14.013419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.710008Z","title":null,"venue":null,"work_id":"c5993a54-928e-42f1-9278-84a5f877d890","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.036650Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:300881aeb135d2a36431c13d3dfd89a16e24caee96bbd3842cd05a616787e74a","observation_id":"5b4abff3-8beb-49f7-a7c1-3d50a7690256","resolution":{"observed_at":"2026-08-07T14:47:13.796341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.485723Z","title":null,"venue":null,"work_id":"cd362e8f-db6b-400e-a0c0-c7f598d2451c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.108835Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:28ecc7f7e0e39879e0137e2b83ebc37a1128ce324cddae82f846708e44698876","observation_id":"abc896a7-b9fd-408f-bd0a-846072760919","resolution":{"observed_at":"2026-08-07T14:47:13.576523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.295730Z","title":"(omitted)","venue":null,"work_id":"a6414a86-826a-45fa-9f51-5911aa4b8dd1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.172031Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4fdf6b1069a16b196091a00711f43653e416ce05318d6b4b498405aad4ad4563","observation_id":"ced03377-9381-4161-b85c-b220bf757368","resolution":{"observed_at":"2026-08-07T14:47:13.388357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:13.140928Z","title":null,"venue":null,"work_id":"92622e29-d427-40cb-bfa3-cc061eaddce7","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.243031Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:c52622ecd55e8d3935bc8d0fb66558930787df0c387570d7bac803b190804265","observation_id":"f573cfbc-36ef-446e-9573-f9839bb84492","resolution":{"observed_at":"2026-08-07T14:47:13.205552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.936017Z","title":null,"venue":null,"work_id":"090982ac-f7e3-4d9f-bdc2-76610cea76ae","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.329557Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3639165ff36b748968affe4f5436d954f615f1ec97ca843a924bda601d7517fe","observation_id":"39e1111c-a514-4bee-852a-aaaffe5bf422","resolution":{"observed_at":"2026-08-07T14:47:13.032118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.713870Z","title":"System prompt of the shard user","venue":null,"work_id":"3a68fd1a-bee2-4fb5-8c31-3728fd809bd8","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.387429Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:311a8a3cce3fed81f55652c35de99132624cfb6a59c977ae42256fca3c0ebb29","observation_id":"0586bd0d-8a26-4cba-a80f-608b5376abc3","resolution":{"observed_at":"2026-08-07T14:47:12.801042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.548113Z","title":"You should select shards that are most “basic” and currently **the most relevant**","venue":null,"work_id":"b1933475-ee11-48ba-bf80-4565d6e88be9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.438122Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:508ab8197a61f552794dae22847eaea66707fcd4610cb75edac39a29e589cda5","observation_id":"fe421636-1cda-4752-a4c7-0e1811b0524d","resolution":{"observed_at":"2026-08-07T14:47:12.612789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.326960Z","title":null,"venue":null,"work_id":"217990e6-bcee-414c-818f-b3d2d0fd592a","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.498573Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:5cd1575c899f73ed79aff65dd3067df1eed1a27cefd2e634b4aee4788443ce4a","observation_id":"61eec6c3-82a6-45fd-8c99-afb6f1dbf4b4","resolution":{"observed_at":"2026-08-07T14:47:12.444651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:12.118053Z","title":null,"venue":null,"work_id":"e3902525-ce83-4fc3-9a90-e990047233b9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.563626Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:32b3fb6e08fd0e057021fecb9065d1c8f3ef4a8753d9e48f852ee0f856ce7ea0","observation_id":"01998609-5024-4963-9a26-b7ac132e56a3","resolution":{"observed_at":"2026-08-07T14:47:12.215315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.919729Z","title":null,"venue":null,"work_id":"4e519b12-b225-4847-aeca-6115825b1b5d","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.632882Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:bf9b42abc5ca41732a76c4fc3e5fe710a69de9c7bef6d3d1fdb196a94e4ec819","observation_id":"a00a1721-ac01-4169-a434-4132f4fa254e","resolution":{"observed_at":"2026-08-07T14:47:12.010602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.655923Z","title":"Consider these alternative directions:","venue":null,"work_id":"bbfd1057-014d-4f9a-87b7-cbca9df878f4","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.697431Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4aafd27a6187e83beac84364e97b38d27c89f85884bd901b43c9df260d550fbf","observation_id":"68fd14cb-7d3b-49db-a844-7b2ec6880530","resolution":{"observed_at":"2026-08-07T14:47:11.782448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.429970Z","title":null,"venue":null,"work_id":"5d7a1a44-2e5e-4201-a17f-90009461060f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.750391Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:93ae7a6f77d3036632e724252e435ea050f60c9235473f43a4eb5f9092842334","observation_id":"c0640aac-3e59-48a3-8f5f-f7751b82b3d3","resolution":{"observed_at":"2026-08-07T14:47:11.515593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.230067Z","title":"thought\":","venue":null,"work_id":"f134e1f0-fbc3-4997-8c84-4bf6b061d378","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.817573Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:d1b8790327b7207af2072ab4ae8c890eba18fc85c28d6cac78d75065a3cb3c88","observation_id":"e03f52fd-6f48-4e9e-a905-5be12ffb984c","resolution":{"observed_at":"2026-08-07T14:47:11.322347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:11.068707Z","title":"These metrics typically possess a theoretical upper bound (e.g., 1.0 for accuracy)","venue":null,"work_id":"921b2bbc-6858-4616-94c0-002392763137","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.876902Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:00eb2b0094f742a3f1f0bc90a2d8dd612c00897f11fee0251f1175f13b7b5990","observation_id":"08b44ea8-7e94-43b7-ae2c-59c7fe631b6d","resolution":{"observed_at":"2026-08-07T14:47:11.133038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.920817Z","title":"Avg Score","venue":null,"work_id":"a6809f84-58b8-41a2-b8e3-e16ca7e27df3","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:54.963256Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:769d7d281650fd48646f0ebca3b84f710cafcf26f32232e81159ac882025b666","observation_id":"3867b804-24e2-44c1-a911-bfdd99025404","resolution":{"observed_at":"2026-08-07T14:47:10.993255Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.718085Z","title":null,"venue":null,"work_id":"56441d79-e40a-4ad6-b5af-800b440a44c9","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.111812Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:e1cc245feeec17177fa74f523dc8556545c8b64fe68c740199751354043dadb7","observation_id":"5ece733e-534c-4558-a899-a6602b0b4ade","resolution":{"observed_at":"2026-08-07T14:47:10.812818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.490861Z","title":null,"venue":null,"work_id":"d22b56d7-5c13-4f25-80d7-c36fe008468c","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.260964Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:35d743fe0b038a14fd2fa8557e342fbb1c8ece80e03a4c955fbd1387e6eb13bf","observation_id":"452d1b4f-bbd5-4d27-87f7-d38268ccd254","resolution":{"observed_at":"2026-08-07T14:47:10.593754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.282248Z","title":null,"venue":null,"work_id":"b2b82290-ce26-4f25-b352-474a5a46c779","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.352626Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:cae7b8053ad92f2caa4a6d1d53c29370ae43f365a393ddec805b6c74789aa4a5","observation_id":"5f2437a7-1f80-4206-8c1e-61437968fecf","resolution":{"observed_at":"2026-08-07T14:47:10.372803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:10.092927Z","title":null,"venue":null,"work_id":"01996251-67d4-40c7-8c3d-9d515366ca7f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.451451Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:58bd5ef903f8e4f66fe55a5f53e9dba235c8daa68484d49125f055fe42237ef5","observation_id":"3e3b5a8e-27f3-4c71-80d0-ea858804a528","resolution":{"observed_at":"2026-08-07T14:47:10.202351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.972133Z","title":"metric_name","venue":null,"work_id":"3040978e-e51b-40dd-9957-534cfcc777ad","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.590513Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:57d468c3d59690e4727516933e8a7cba370fff913801d994e898e21b02fcc65f","observation_id":"ab1d6e91-d1a7-4be2-9b8c-69ccf5b7bffc","resolution":{"observed_at":"2026-08-07T14:47:10.045925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.803522Z","title":"yes\" -> 1 and","venue":null,"work_id":"50b767ee-88dc-40f7-95e7-52943d7cc6c1","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.662945Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:eef0c3bea8b1fbeca7a6e9649e3be7c55145c43a6ddae539f770e5e30cef107c","observation_id":"7ad91a31-f9e9-4e82-8625-b0d07e08bea2","resolution":{"observed_at":"2026-08-07T14:47:09.885569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.586397Z","title":null,"venue":null,"work_id":"fb36fa58-32ef-48a3-bdc2-ce0083f59f06","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.725076Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:ab1eb84c90cb8cdcdac32b35eeb8b12d93a4a75b0199d76247b7a62582b05af5","observation_id":"8d0d2a8d-68b6-4efa-b0dc-f8fab30074b6","resolution":{"observed_at":"2026-08-07T14:47:09.699479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.361793Z","title":null,"venue":null,"work_id":"57ffa8c2-e7b2-437d-9625-6998d89f1c43","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.783517Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:fc82d2f55fd55c089301cd69cde7667676e275ef99da0ce50d5e70b35b494ccb","observation_id":"2071ba24-4855-49a0-bb2e-cbf4492b39ba","resolution":{"observed_at":"2026-08-07T14:47:09.470809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:09.155952Z","title":null,"venue":null,"work_id":"447254f7-26c3-4c35-8c83-a998796e02aa","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.853949Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:33a3fe495b9d705339ce17795fe387015f5b4a3e6ed2061dcaeea7ba32e3b238","observation_id":"fb5b5414-d716-406e-bd25-f1b24032addf","resolution":{"observed_at":"2026-08-07T14:47:09.259524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.973343Z","title":null,"venue":null,"work_id":"92b56f2a-edbe-49f3-a362-e985ae5b468f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:55.932041Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:4c3d4a1bf7842f7f64adb6a64d37f6733700468eea0a226da8dbcbddd5cc3e16","observation_id":"1fa1beae-08ab-4a36-98b7-65eaefcfe2d3","resolution":{"observed_at":"2026-08-07T14:47:09.047479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.763479Z","title":"<markdown>","venue":null,"work_id":"f962081b-d6a2-498c-9940-122910e93ac7","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.019587Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:44441e5a56ff188e6d644937554875a8d91e218954e0e874c7934462cd1713fd","observation_id":"05224c24-238a-41a0-a667-85a3968efa4e","resolution":{"observed_at":"2026-08-07T14:47:08.852908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.592759Z","title":"!pip install","venue":null,"work_id":"062b70fb-51a4-4704-8cca-cf2f750ab25f","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.091977Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:3fd9ccb333df339bde51280c6c992a856fd8bc4582fbe4c027a90e108b11cae1","observation_id":"770a40a6-c077-4eb1-9a81-4041e4ac5ce7","resolution":{"observed_at":"2026-08-07T14:47:08.668817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.378133Z","title":"- Load the test feature set from the given directory, using <original_name>_test_features","venue":null,"work_id":"cfd3e7ab-0c15-45ad-a780-915ad47a0829","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.212625Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:808fc190b50e7bd8d25310c20d99fe66ac97dd7a05814757ad927686cfa07167","observation_id":"b231fb36-f85a-4075-98aa-a770e510818f","resolution":{"observed_at":"2026-08-07T14:47:08.478825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:08.137018Z","title":"- Apply the identical transformations to the test feature set","venue":null,"work_id":"a7dbee5f-2df9-4e35-924d-06221ae04d63","year":null},"citing_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:56.334492Z"},"links":{"citing_paper":"/paper/2505.18223"},"observation_digest":"sha256:9c390ba3d595c79e329ef2f62c7471f563321189c87e0d0bc97f66aa05a10eaa","observation_id":"144be1e0-9337-44e8-a6e4-a05306a4f790","resolution":{"observed_at":"2026-08-07T14:47:08.224725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 5 inbound Pith citation observations for arXiv:2505.18223."}