{"as_of":"2026-08-21T08:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7307211ce81ff500cce8d9936776f7f8153a4f30717e45df35fd1d0eedef6f32","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:02:26.410742Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00018/citation-record","integrity":"/paper/2608.00018/integrity","json":"/paper/2608.00018/citation-record.json","paper":"/paper/2608.00018"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.15330","last_updated":"2020-12-30T21:29:48Z","snapshot_observed_at":"2026-08-16T18:55:08.478917Z","submitted_at":"2020-12-30T21:29:48Z","title":"Sequential Deep Learning for Credit Risk Monitoring with Tabular Financial Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15330","snapshot_observed_at":"2026-08-04T02:02:23.763275Z","title":"Sequential deep learning for credit risk monitoring with tabular financial data,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.763275Z"},"links":{"cited_paper":"/paper/2012.15330","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:bc3b45030f695b6164131bf88f8e0b503bd94e86b22f6b2a37b95c584d9d6a3b","observation_id":"bd756d7b-4393-4742-9042-02070270ad44","resolution":{"observed_at":"2026-08-04T02:02:23.763275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.812314Z","title":"Trust issues: Uncertainty estima- tion does not enable reliable ood detection on medical tabular data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.812314Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d08457757cce53c5d0a800d04e583aa84d6978453595045abb80085b5cddc0dc","observation_id":"714680ab-e06d-4dd5-953b-13d504c018a5","resolution":{"observed_at":"2026-08-04T02:02:23.812314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.874660Z","title":"Benchmarking spreadsheet systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.874660Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:feafa5f79cce3a474a338af31f6a08016f08884866413427fde011645adb1b01","observation_id":"b0cacf37-073f-4346-8669-81bbe4a39a60","resolution":{"observed_at":"2026-08-04T02:02:23.874660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.900548Z","title":"Overview and importance of data quality for machine learning tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.900548Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:853536d484a971fd0b6eee73fc7cdaeec8c12ca79ce9e4a1d6ab6b7adfb72b5c","observation_id":"123742d9-9a22-4dfe-8d98-6489ff95d4f3","resolution":{"observed_at":"2026-08-04T02:02:23.900548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.942421Z","title":"Data mining preparation: process, techniques and major issues in data analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.942421Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ecbdb9e07f2be02519dc3ae510eaf25ec9083bbdba49f4b264ba954820698a05","observation_id":"5a861eaa-1ccb-4263-9630-a282b86f82f9","resolution":{"observed_at":"2026-08-04T02:02:23.942421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:23.990689Z","title":"Large language model for table processing: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:23.990689Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:134c60b1db5ecd220bf19cece283ac93c8d879bbde62f3aee592d19215c4afac","observation_id":"e3d360b8-db55-4bb4-90ac-a4707b96e2f6","resolution":{"observed_at":"2026-08-04T02:02:23.990689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01678","last_updated":"2024-10-28T22:24:01Z","snapshot_observed_at":"2026-08-20T13:04:40.817382Z","submitted_at":"2023-12-04T07:01:54Z","title":"Jellyfish: A Large Language Model for Data Preprocessing","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01678","snapshot_observed_at":"2026-08-04T02:02:24.031857Z","title":"Jellyfish: A large lan- guage model for data preprocessing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.031857Z"},"links":{"cited_paper":"/paper/2312.01678","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:76ee4fa0c95dcfbe591476ef784f939e49eb35518d5a6a6310828f92096ae846","observation_id":"b2bbd933-6bc9-479b-a7ee-4c9aaee98964","resolution":{"observed_at":"2026-08-04T02:02:24.031857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.058617Z","title":"Table-llm-specialist: Language model specialists for tables using iter- ative fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.058617Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:9db312d36d7c93b78215cc293b3fbc23a1c6ae57fcc157de0937dc978d67e76e","observation_id":"e772b09b-bfd6-4fbd-b1b8-2825e17bac9a","resolution":{"observed_at":"2026-08-04T02:02:24.058617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.098296Z","title":"Iterclean: An iterative data cleaning framework with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.098296Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:2bbeb74dc82c775b7b08215f373d32c7a5f5fa64066907388016a96bc4649939","observation_id":"c0b3f172-ac50-4146-a831-40cedc4b3a6b","resolution":{"observed_at":"2026-08-04T02:02:24.098296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.155269Z","title":"Cocoon: Semantic table profiling using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.155269Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:2b41518d54ed06d5a64aaeb8587bd6885efd8fa6a83dd21f8ae7bb90734168e9","observation_id":"5a659b93-ef57-4fb8-95d7-76242b6a9d2a","resolution":{"observed_at":"2026-08-04T02:02:24.155269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.195429Z","title":"Retclean: Retrieval-based data cleaning using llms and data lakes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.195429Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:a9364f9d75edddbd5cb418011ab72c40341837cca15729dc4c1b2d14332616ac","observation_id":"bfd7102d-479e-4d89-b6d8-519c7e4f4a30","resolution":{"observed_at":"2026-08-04T02:02:24.195429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.237831Z","title":"A zero-training error correction system with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.237831Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:6dca611f82579701bf035f6a3d82aba285c3d64945addbd2bb404173dea07ae1","observation_id":"172bb5eb-dcfa-4ebd-8696-354adb151384","resolution":{"observed_at":"2026-08-04T02:02:24.237831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.268320Z","title":"Tap4llm: Table provider on sampling, augmenting, and packing semi-structured data for large language model reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.268320Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d163c71ff4eec512302ee07ab6fbf49976cc0813331a4655f777362bde78e5b7","observation_id":"81a38ad0-ff84-42b4-a8c4-0afb7fe5501e","resolution":{"observed_at":"2026-08-04T02:02:24.268320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.299457Z","title":"Table-gpt: Table fine-tuned gpt for diverse table tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.299457Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:01ab6b0f441c5bf32ebff5b238666501876ca5d70cb59e9f50af7805b526957e","observation_id":"0db0ab6b-0dd7-4ef1-9e8e-f0283ff3e56a","resolution":{"observed_at":"2026-08-04T02:02:24.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.339800Z","title":"Tablellm: Enabling tabular data manipulation by llms in real office usage scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.339800Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:b384eff7f39c6445f491db0bfca3c348ee3048e25022a4eb0574e3a82ff92990","observation_id":"d610d362-ddbd-45fb-bbfa-37ac360a2ea6","resolution":{"observed_at":"2026-08-04T02:02:24.339800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.382245Z","title":"Unidm: A unified framework for data manipulation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.382245Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:398adbfa5f5287532883ed64551c17c4dec21064b0240e12e72f5f7d590b586d","observation_id":"174f2187-5b2c-4969-b7c2-09c532e4c452","resolution":{"observed_at":"2026-08-04T02:02:24.382245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12063","last_updated":"2024-06-01T07:35:26Z","snapshot_observed_at":"2026-08-19T09:50:10.885772Z","submitted_at":"2024-05-20T14:34:01Z","title":"CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12063","snapshot_observed_at":"2026-08-04T02:02:24.456316Z","title":"Clamber: A benchmark of identifying and clarifying ambiguous information needs in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.456316Z"},"links":{"cited_paper":"/paper/2405.12063","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:75a167a580ff88685ecea3a9ff60137acbcb5ffecf9d01c60d9ab3f989107c37","observation_id":"f602e49b-25a1-4ada-aa7c-b311a32adbdc","resolution":{"observed_at":"2026-08-04T02:02:24.456316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01633","last_updated":"2024-06-01T15:54:45Z","snapshot_observed_at":"2026-08-20T00:01:39.499089Z","submitted_at":"2024-06-01T15:54:45Z","title":"On Overcoming Miscalibrated Conversational Priors in LLM-based Chatbots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01633","snapshot_observed_at":"2026-08-04T02:02:24.496620Z","title":"On over- coming miscalibrated conversational priors in llm-based chatbots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.496620Z"},"links":{"cited_paper":"/paper/2406.01633","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:84a1865edf12c943a27c233d075fead228736266dac8558cd44d85217571cb77","observation_id":"1e1b6631-4eb7-4f92-88e6-9508b962dc98","resolution":{"observed_at":"2026-08-04T02:02:24.496620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.523316Z","title":"Why johnny can’t prompt: how non-ai experts try (and fail) to design llm prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.523316Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:905cd11d73c8cba46fbccc66d2c2bbbee232b0f65f2d1fa5030a6bcd457a5cad","observation_id":"4d362a67-2658-4acf-8c00-ff0279205e1e","resolution":{"observed_at":"2026-08-04T02:02:24.523316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.560033Z","title":"Evaluating text-to-sql model failures on real-world data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.560033Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:dc212a15fc8aca7498430d1d14dfd1c1ed165b254b0b2a6bad080135f89e9529","observation_id":"344a4603-1f1b-446f-88c9-b2ff59c1fb1e","resolution":{"observed_at":"2026-08-04T02:02:24.560033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.594794Z","title":"Spreadsheetbench: Towards challenging real world spreadsheet manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.594794Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:f35ad16ddd9b0746c54ba8ff11d07fda2c57c327a4bb9925bcf3c56f18496f9b","observation_id":"654c0c27-14ae-419f-a276-768da14d244b","resolution":{"observed_at":"2026-08-04T02:02:24.594794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.630830Z","title":"Sheetagent: towards a generalist agent for spreadsheet reasoning and manipulation via large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.630830Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:56f6e2fca82295b8b89a84a68ff777dfc100073a0aac654c691275641fadda0a","observation_id":"92fc8ac8-3bfe-4a22-8182-e1e3d71620a0","resolution":{"observed_at":"2026-08-04T02:02:24.630830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06724","last_updated":"2025-08-23T21:01:08Z","snapshot_observed_at":"2026-08-20T12:31:19.016915Z","submitted_at":"2024-12-09T18:13:27Z","title":"AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06724","snapshot_observed_at":"2026-08-04T02:02:24.664176Z","title":"Autodcworkflow: Llm-based data cleaning workflow auto-generation and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.664176Z"},"links":{"cited_paper":"/paper/2412.06724","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:eab8afc9f4a32ebbe86fe19e751ad16644ce863ac60d5f02ffb581569ad67d6e","observation_id":"23d57a55-fd37-44de-b31b-d1c211e8e885","resolution":{"observed_at":"2026-08-04T02:02:24.664176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.740787Z","title":"Datagovbench: Benchmarking llm agents for real-world data governance workflows,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.740787Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:23663827d90b7b010f4804e75733e464a8889f59e4d5f2b4944d18a338b6865a","observation_id":"9da3e50f-bed5-4a35-9d4c-bcdcfb29b3f4","resolution":{"observed_at":"2026-08-04T02:02:24.740787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00305","last_updated":"2015-08-03T02:53:01Z","snapshot_observed_at":"2026-08-19T03:11:23.683294Z","submitted_at":"2015-08-03T02:53:01Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.00305","snapshot_observed_at":"2026-08-04T02:02:24.808758Z","title":"Compositional semantic parsing on semi- structured tables,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.808758Z"},"links":{"cited_paper":"/paper/1508.00305","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:874a47a2e78ad7ff66e0071506f230499e3037d05afd6250577f6dcef9431fc9","observation_id":"29767ef8-07e4-4400-a225-3f8b76b33b0e","resolution":{"observed_at":"2026-08-04T02:02:24.808758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-14T04:55:53.397142Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-04T02:02:24.858361Z","title":"Tabfact: A large-scale dataset for table-based fact verification,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.858361Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:aac51023e485ac49eb7c337b6ce506c2333af52f2b617a7520eb37b029c01bea","observation_id":"cd7e1f2e-0a50-4815-b429-1fb8a3ce9e01","resolution":{"observed_at":"2026-08-04T02:02:24.858361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:24.940855Z","title":"Sheetcopilot: Bringing software productivity to the next level through large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:24.940855Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:90b7df83a2f0fa620b62d1e54db3da73fbac8fe7117826f4a65ea7111b8fec63","observation_id":"656de7d2-4267-4caf-8a73-b96f76c1d2e0","resolution":{"observed_at":"2026-08-04T02:02:24.940855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.045461Z","title":"Wrangler: Interactive visual specification of data transformation scripts,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.045461Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:1d5c615cd3225d3bcad8feb58a0aefcd86500a35e80a9a3c9def061f6ffff0b5","observation_id":"eea4f836-1d92-4f9e-9336-14a0497f3847","resolution":{"observed_at":"2026-08-04T02:02:25.045461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.093525Z","title":"Intercode: Stan- dardizing and benchmarking interactive coding with execution feed- back,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.093525Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:115c0e98c2c31fbd0f431921a34a582a817cf09a9bef92abc4d0029a1b7e0175","observation_id":"0376c9fd-22f2-46c6-b891-65c3ab056975","resolution":{"observed_at":"2026-08-04T02:02:25.093525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.161194Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.161194Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:e4c8a5e96506c6bd4527ff1d48a16970f98bfb687faed75aa8d59c36eb67e227","observation_id":"d4aba903-87b4-4028-b137-19244b34f62b","resolution":{"observed_at":"2026-08-04T02:02:25.161194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.247961Z","title":"Tablebench: A comprehensive and complex benchmark for table question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.247961Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:f1b4f8a33e3319b0a4cd62c9100ec8c6c5c31fbb57e95073063c2a737fe8a2cf","observation_id":"80bb2fab-1604-4083-91f4-1d1d79212355","resolution":{"observed_at":"2026-08-04T02:02:25.247961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.300938Z","title":"Realhitbench: A comprehensive realistic hierarchical table benchmark for evaluating llm-based table analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.300938Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:3d24de78d887d821ca0bb2559dd4acaa7b2d25134fc1f85ccfe059a2f1ce55a3","observation_id":"ff6730cc-65c3-4663-9aa9-45732b1c002a","resolution":{"observed_at":"2026-08-04T02:02:25.300938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.390812Z","title":"Spreadsheetcoder: Formula prediction from semi-structured context,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.390812Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:d60764567c97e7dbf694987002261b2397ae04a14c096962ebb03e27dc17b429","observation_id":"4bf0f05d-b4e0-4b06-85fd-58f0894b31bd","resolution":{"observed_at":"2026-08-04T02:02:25.390812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14495","last_updated":"2023-10-23T02:00:55Z","snapshot_observed_at":"2026-08-16T14:49:56.414662Z","submitted_at":"2023-10-23T02:00:55Z","title":"InstructExcel: A Benchmark for Natural Language Instruction in Excel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14495","snapshot_observed_at":"2026-08-04T02:02:25.469087Z","title":"Instructexcel: A benchmark for natural language instruction in excel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.469087Z"},"links":{"cited_paper":"/paper/2310.14495","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:bb59811f92a46ff218543703572e5238c0d3a9c1427c8e0aecb31aa98d63dd4e","observation_id":"770b2ba7-be74-4068-93b4-c84a45d1c020","resolution":{"observed_at":"2026-08-04T02:02:25.469087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-04T02:02:25.560821Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.560821Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:429d09e8d38c86bdb9fc3ae209a21455b9c450a06917d53e122f4e70f2c3367d","observation_id":"f5a3bfbd-a7ef-4e93-8a1a-626223eff658","resolution":{"observed_at":"2026-08-04T02:02:25.560821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.629189Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.629189Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:f698c8ef7ddd66a9d375d3416be2c99e6d9c17a1b4136dc9cdccdde2e43a6312","observation_id":"4633509a-84cc-45c2-bdf4-8e2933b16ea9","resolution":{"observed_at":"2026-08-04T02:02:25.629189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01747","last_updated":"2025-09-04T16:22:32Z","snapshot_observed_at":"2026-08-16T13:03:20.231667Z","submitted_at":"2024-11-04T02:08:59Z","title":"DynaSaur: Large Language Agents Beyond Predefined Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01747","snapshot_observed_at":"2026-08-04T02:02:25.766495Z","title":"Dynasaur: Large language agents beyond predefined actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.766495Z"},"links":{"cited_paper":"/paper/2411.01747","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:3f6adcaab713f84dde38277eb5cf0725d270ed9ed31cb018ea9b8378e102b036","observation_id":"d742f155-ebfa-4348-9c78-f6068e7a937b","resolution":{"observed_at":"2026-08-04T02:02:25.766495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.825097Z","title":"Codeassistbench (cab): Dataset & benchmarking for multi-turn chat-based code assis- tance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.825097Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ae8d81255b6621de4b694aa2593bceb5689ac586932e0d1f3f5a9537ca74fc61","observation_id":"378e043d-e845-4931-9adc-7ffc6bcb9e97","resolution":{"observed_at":"2026-08-04T02:02:25.825097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18223","last_updated":"2025-06-06T06:33:47Z","snapshot_observed_at":"2026-08-13T09:52:38.599828Z","submitted_at":"2025-05-23T09:37:52Z","title":"IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18223","snapshot_observed_at":"2026-08-04T02:02:25.908482Z","title":"Ida-bench: Evaluating llms on interactive guided data analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.908482Z"},"links":{"cited_paper":"/paper/2505.18223","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:2a7a7f86d7d7b9d8f7189082de7cee8aaeb293c08733d319349595da1ed1c35d","observation_id":"9a5bb880-d645-4644-bb41-fec033f6c5fa","resolution":{"observed_at":"2026-08-04T02:02:25.908482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:25.968696Z","title":"Learning to ask: When llm agents meet unclear instruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:25.968696Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:709863797a861b38478602b4281861efbdb22cb82aba25e89dc7534753695855","observation_id":"59e10e46-5193-4893-8c77-cf204d9dd732","resolution":{"observed_at":"2026-08-04T02:02:25.968696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.083143Z","title":"Clarifymt-bench: Benchmarking and improving multi-turn clarification for conversational large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.083143Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:949e6f30da08540947808e19f22b5b00f88eb2b74f03c28f8789d6ee6508f704","observation_id":"569a5ceb-1326-4454-b0c1-6e8016778148","resolution":{"observed_at":"2026-08-04T02:02:26.083143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.147012Z","title":"Metagpt: Meta programming for a multi-agent collaborative framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.147012Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:779c0e71f2267e2439662b84bf4897c3fb12e6b10d0d2d15d53edb86f620c7a3","observation_id":"a740700d-089d-4f31-a57d-3319feaf15d3","resolution":{"observed_at":"2026-08-04T02:02:26.147012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.221744Z","title":"Camel: Communicative agents for","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.221744Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:ddf9106a553d0743d918ce031811389e6e86ccbfa083da44f38fd45597a1fc64","observation_id":"dee2d82e-d316-40de-abb6-ffd977b64fe3","resolution":{"observed_at":"2026-08-04T02:02:26.221744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08291","last_updated":"2025-06-02T00:45:04Z","snapshot_observed_at":"2026-08-16T14:10:18.642201Z","submitted_at":"2024-03-13T06:54:15Z","title":"CleanAgent: Automating Data Standardization with LLM-based Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08291","snapshot_observed_at":"2026-08-04T02:02:26.305485Z","title":"Cleanagent: Automating data standard- ization with llm-based agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.305485Z"},"links":{"cited_paper":"/paper/2403.08291","citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:7849e766cc39663148ce3545e0e0ce27022fddb1c4b9ad646d9b3651d671d61f","observation_id":"7a47da4d-3147-46da-83ea-9aded52b7975","resolution":{"observed_at":"2026-08-04T02:02:26.305485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:02:26.410742Z","title":"Chatdev: Communicative agents for software development,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T02:02:26.410742Z"},"links":{"citing_paper":"/paper/2608.00018"},"observation_digest":"sha256:bae84617a70f3988205c2b3111a21dd8e8897b264ae35f0a2c5efdbca521da4e","observation_id":"d2af742e-0cc9-41d3-ae1e-fdee3195647f","resolution":{"observed_at":"2026-08-04T02:02:26.410742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00018","last_updated":"2026-06-29T14:15:46Z","latest_version":1,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-16T08:17:24.357286Z","submitted_at":"2026-06-29T14:15:46Z","title":"CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.00018."}