{"as_of":"2026-08-17T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd0c04be67cd01a4883890beec27cc7b755525a1abfb26059184a847b8314d10","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":67,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:22:36.386473Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-12T21:14:04.994413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09012","last_updated":"2025-04-23T02:34:59Z","snapshot_observed_at":"2026-08-16T07:36:17.507971Z","submitted_at":"2024-11-13T20:36:02Z","title":"AstroMLab 3: Achieving GPT-4o Level Performance in Astronomy with a Specialized 8B-Parameter Large Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:14:04.994413Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2411.09012"},"observation_digest":"sha256:319a6ca69324aac4241f984b5232376724fbb20c62503fd0551faad4611e958d","observation_id":"ea070a9b-bd37-49f5-9c32-6d0352d86f8a","resolution":{"observed_at":"2026-08-12T21:14:04.994413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-12T19:02:19.083819Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11910","last_updated":"2024-11-24T12:59:44Z","snapshot_observed_at":"2026-08-14T02:34:22.228518Z","submitted_at":"2024-11-17T13:40:35Z","title":"AIGS: Generating Science from AI-Powered Automated Falsification","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:19.083819Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2411.11910"},"observation_digest":"sha256:bddcd9bf888732a705de7bde48fcf1567da9eb1a9600121f31f22723856e120a","observation_id":"29434ba2-8431-4776-9788-b08b6d2a65f3","resolution":{"observed_at":"2026-08-12T19:02:19.083819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-10T21:39:25.157389Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04306","last_updated":"2025-01-08T06:44:02Z","snapshot_observed_at":"2026-08-13T09:15:34.978879Z","submitted_at":"2025-01-08T06:44:02Z","title":"LLM4SR: A Survey on Large Language Models for Scientific Research","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:39:25.157389Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2501.04306"},"observation_digest":"sha256:50681b1418c979386b3fd7d2a2062bafc9d91ed88b586d59e504eaef8402b2c3","observation_id":"cfb50cf9-b706-4218-be20-4918cdd4f817","resolution":{"observed_at":"2026-08-10T21:39:25.157389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:2ffc0815afbaa360f99dd8c145de26835571417f42be0069b0a71f4836a742ac","observation_id":"56403468-0208-471c-8d4d-23555eee82b9","resolution":{"observed_at":"2026-05-23T04:32:32.948145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-16T12:22:36.386473Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12976","last_updated":"2025-04-17T14:29:18Z","snapshot_observed_at":"2026-08-16T17:09:27.124916Z","submitted_at":"2025-04-17T14:29:18Z","title":"Sparks of Science: Hypothesis Generation Using Structured Paper Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:22:36.386473Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2504.12976"},"observation_digest":"sha256:4e41a37a48d54673b7c63af74946c56505d466c145ee057671989ec85d0cdce8","observation_id":"54e66ece-9b82-4ad2-94d5-dfa5d0a6c5ed","resolution":{"observed_at":"2026-08-16T12:22:36.386473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2504.19678","last_updated":"2026-03-06T19:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T11:08:22Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:37.873567Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2504.19678"},"observation_digest":"sha256:6059f8e3745ddcfb4d7b2362b5cb8c958b7989f7844652c87762a0f1b8bc1c2b","observation_id":"35d435ba-a4ea-4159-9de9-391ecf6e661d","resolution":{"observed_at":"2026-05-15T02:57:38.399364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-16T05:44:03.815973Z","title":"and Dey, V., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19912","last_updated":"2025-04-28T15:41:28Z","snapshot_observed_at":"2026-08-16T05:37:46.940986Z","submitted_at":"2025-04-28T15:41:28Z","title":"Can AI Agents Design and Implement Drug Discovery Pipelines?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:44:03.815973Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2504.19912"},"observation_digest":"sha256:84f693879b33387bb25939e58a70d4cb4b4be7caf9c59038bf89e03e1f3d6705","observation_id":"ef1c04c4-3289-40a4-9644-8b12fc8bbd36","resolution":{"observed_at":"2026-08-16T05:44:03.815973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-16T05:53:26.078433Z","title":"N.; Burns, B.; Adu-Ampratwum, D.; Huang, X.; Ning, X.; Gao, S.; Su, Y.; and Sun, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20117","last_updated":"2025-05-03T16:45:38Z","snapshot_observed_at":"2026-08-16T11:16:22.408357Z","submitted_at":"2025-04-28T07:18:45Z","title":"ResearchCodeAgent: An LLM Multi-Agent System for Automated Codification of Research Methodologies","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T05:53:26.078433Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2504.20117"},"observation_digest":"sha256:b6258e9fe2126c6c953ad19b882c0b59f41b1941a24a38522e9ad6727d0b19c8","observation_id":"817f76da-d195-4d65-8fae-2f5f5bd6b4e5","resolution":{"observed_at":"2026-08-16T05:53:26.078433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T15:09:32.267308Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16100","last_updated":"2025-05-22T01:02:21Z","snapshot_observed_at":"2026-08-13T11:17:58.614355Z","submitted_at":"2025-05-22T01:02:21Z","title":"BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:32.267308Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2505.16100"},"observation_digest":"sha256:18b3feb122f3dc0642b8f8d84e1ce82204b2c7b400ad2263be9b93b3595a1bf7","observation_id":"57b8442d-9b0d-43ef-8a8a-b526983ee376","resolution":{"observed_at":"2026-08-07T15:09:32.267308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T12:20:42.230426Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24785","last_updated":"2025-06-02T01:59:50Z","snapshot_observed_at":"2026-08-16T19:56:39.249899Z","submitted_at":"2025-05-30T16:46:29Z","title":"EXP-Bench: Can AI Conduct AI Research Experiments?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:20:42.230426Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2505.24785"},"observation_digest":"sha256:6ff1d6bdadce1705e774c99fae791fc4b5cf56cfae0be483d436d333f8503e01","observation_id":"88508b9d-2c41-4609-a8b3-28574d48c1da","resolution":{"observed_at":"2026-08-07T12:20:42.230426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T12:18:50.860148Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24876","last_updated":"2026-05-24T03:59:43Z","snapshot_observed_at":"2026-08-15T02:52:54.149121Z","submitted_at":"2025-05-30T17:59:53Z","title":"Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:50.860148Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2505.24876"},"observation_digest":"sha256:daf7752e2d205437f0d01bce896216ae6c97ef894ae83e5fcebeb654ebb41ba1","observation_id":"b604650e-6e04-4d51-8e11-39f3f68716b7","resolution":{"observed_at":"2026-08-07T12:18:50.860148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T10:51:57.940291Z","title":"Llmarena: Assessing capabilities of large language models in dynamic multi-agent environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04098","last_updated":"2025-06-10T13:14:14Z","snapshot_observed_at":"2026-08-15T10:08:43.288385Z","submitted_at":"2025-06-04T15:55:27Z","title":"TextAtari: 100K Frames Game Playing with Language Agents","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:57.940291Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.04098"},"observation_digest":"sha256:35d99826ec1aa21d9b143f32202212bdc22143f05f73e377011870fd57fcabb6","observation_id":"d9e984a3-57ee-4d7a-bf01-87859956317b","resolution":{"observed_at":"2026-08-07T10:51:57.940291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T06:00:19.467715Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:19.467715Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:36e173e5a555643f54f82ecf35398262969f09eb1a9863f88c2b6c27d26211a3","observation_id":"6a271e68-1308-4909-8500-8452e86d43b9","resolution":{"observed_at":"2026-08-07T06:00:19.467715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-14T22:03:22.542485Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:07:39.384613Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.11763"},"observation_digest":"sha256:bbef771b26da858911e713ebe1ee47b9fa941ebe798ee1ecadc1d5c3772bf073","observation_id":"8c408575-b0e8-4906-a807-f5ffc28cd7db","resolution":{"observed_at":"2026-05-16T08:07:39.431114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-07T00:55:16.881460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12312","last_updated":"2025-06-14T02:22:28Z","snapshot_observed_at":"2026-08-13T14:33:19.317608Z","submitted_at":"2025-06-14T02:22:28Z","title":"Perspective on Utilizing Foundation Models for Laboratory Automation in Materials Research","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:55:16.881460Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.12312"},"observation_digest":"sha256:ff50860cbbf8e139619ad8b2f7840b710d2540c973a3499612b27777ff5e5e3c","observation_id":"0b835d3e-c055-4cc5-a265-10a43a846660","resolution":{"observed_at":"2026-08-07T00:55:16.881460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-15T19:54:52.985789Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15740","last_updated":"2025-07-08T21:23:22Z","snapshot_observed_at":"2026-08-17T01:39:08.152105Z","submitted_at":"2025-06-17T15:46:15Z","title":"SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:52.985789Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.15740"},"observation_digest":"sha256:1a2f91b56969039526456074e15026d5535f26955665c2e01b33554b53f64212","observation_id":"5d1f6fcf-7734-4252-98b0-c18c8d5ba657","resolution":{"observed_at":"2026-08-15T19:54:52.985789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T23:26:56.564539Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-15T20:12:18.032530Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.564539Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:74b892ee5c908ffee3f9667e8429b105cc73cf3e65d87557b99e46b15280e0ff","observation_id":"3e509b4e-623e-4f89-aee5-3cf5d378c250","resolution":{"observed_at":"2026-08-06T23:26:56.564539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T23:05:06.557517Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19998","last_updated":"2025-06-24T20:30:44Z","snapshot_observed_at":"2026-08-14T19:48:12.546319Z","submitted_at":"2025-06-24T20:30:44Z","title":"Doc2Agent: Scalable Generation of Tool-Using Agents from API Documentation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:05:06.557517Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.19998"},"observation_digest":"sha256:f3c7b48385a7e930a567effdd768f9b9867b372f165542280171eb6abed1bc76","observation_id":"43a63161-5ccf-4255-a97f-5f0e215d83d2","resolution":{"observed_at":"2026-08-06T23:05:06.557517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2506.22598","last_updated":"2026-04-21T20:17:15Z","snapshot_observed_at":"2026-08-16T08:23:51.969336Z","submitted_at":"2025-06-27T19:41:41Z","title":"RExBench: Can coding agents autonomously implement AI research extensions?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T07:33:39.675929Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2506.22598"},"observation_digest":"sha256:14903998d5f0e17c4cc158902dfb24d7e4e2737ef5dd428af1f81c5ac856d3a2","observation_id":"cb1f5943-ef43-4962-834f-af9a07824c62","resolution":{"observed_at":"2026-05-19T07:37:08.883664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T20:45:12.313531Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01903","last_updated":"2025-08-05T16:19:40Z","snapshot_observed_at":"2026-08-08T04:30:09.801268Z","submitted_at":"2025-07-02T17:19:20Z","title":"AI4Research: A Survey of Artificial Intelligence for Scientific Research","version":2},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:12.313531Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2507.01903"},"observation_digest":"sha256:43eeb4ebaf3f8d8640b80c7e5b11da7cd44c852b2f96d3c5fc98a3f5736afa36","observation_id":"23eb0a43-0b73-46a5-a1dd-d05265413501","resolution":{"observed_at":"2026-08-06T20:45:12.313531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:b3835c83301e61700444ef09aba6ca2e3ca201e7df793382d557182ddd38e86e","observation_id":"41d00269-018b-4580-a70c-f1251c57e29f","resolution":{"observed_at":"2026-05-14T22:23:15.664362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T12:44:21.520560Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-13T15:56:19.697323Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.520560Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4fc040c986401e072150ac399a69343f6d2cdf42f757147120de43c123059692","observation_id":"2094d729-a247-4398-969c-1bfd1da0a94a","resolution":{"observed_at":"2026-08-06T12:44:21.520560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-06T10:55:14.623103Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23276","last_updated":"2025-08-01T12:49:36Z","snapshot_observed_at":"2026-08-06T10:54:57.937285Z","submitted_at":"2025-07-31T06:32:06Z","title":"How Far Are AI Scientists from Changing the World?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T10:55:14.623103Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2507.23276"},"observation_digest":"sha256:8589d237c427b0d9104998340f4ce4fd87667ed3c435b6c0e47fc5c554fba91c","observation_id":"91b010aa-dd33-4aed-8976-093534736d28","resolution":{"observed_at":"2026-08-06T10:55:14.623103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-15T16:24:25.055333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05881","last_updated":"2025-09-07T00:51:57Z","snapshot_observed_at":"2026-08-15T18:59:34.502490Z","submitted_at":"2025-09-07T00:51:57Z","title":"GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T16:24:25.055333Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2509.05881"},"observation_digest":"sha256:fbe4e2ceec59c661bcf2fd6411a005ce2ca0aeaf00ddf649791fb0dd26d0643b","observation_id":"4ebaa39f-9807-4cd0-99e4-a865f665e472","resolution":{"observed_at":"2026-08-15T16:24:25.055333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2509.20374","last_updated":"2026-04-26T17:39:58Z","snapshot_observed_at":"2026-08-13T19:20:38.694867Z","submitted_at":"2025-09-19T22:21:26Z","title":"CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T15:05:37.519850Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2509.20374"},"observation_digest":"sha256:8fb6c3cfa8cde8b0d4e060032c3fb6fde3a86be1d422b89213fbe24833979ce0","observation_id":"56d6a0f3-0ff2-47df-9368-50f9ee986c56","resolution":{"observed_at":"2026-05-18T15:06:32.002005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-04T10:36:36.771781Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09801","last_updated":"2026-06-09T14:05:10Z","snapshot_observed_at":"2026-08-16T23:21:32.174404Z","submitted_at":"2025-10-10T19:04:28Z","title":"How can we assess human-agent interactions? Case studies in software agent design","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:36:36.771781Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2510.09801"},"observation_digest":"sha256:d25eaf13f582a1c33c7caaf83f6c2c99e3b2a60fcca36b8a9c557934a803736a","observation_id":"6d279899-50c3-4d4f-9689-283aec17daf3","resolution":{"observed_at":"2026-08-04T10:36:36.771781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-08-15T20:35:30.171419Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:ca4dbb74e48bb7dfd96d8eb3449830722a516e08e46fcb49d687c08f6399a683","observation_id":"808a1a95-e296-4a59-b58f-27eb79084f56","resolution":{"observed_at":"2026-05-21T18:00:27.120470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-02T23:32:11.594053Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-13T15:15:57.031830Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:11.594053Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:b16ef565559af45fe5776f6e34502696a2bb7cba7d7972ff92ec3575ef044208","observation_id":"23341957-a990-4a2c-91e3-80cffd3963ab","resolution":{"observed_at":"2026-08-02T23:32:11.594053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-07-14T21:00:05.911327Z","title":"DeepSeek-AI, Aixin Liu, Bei Feng, Bing Xue, Bingx- uan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, and 1 oth- ers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14771","last_updated":"2026-05-31T08:16:27Z","snapshot_observed_at":"2026-08-15T02:42:04.092461Z","submitted_at":"2026-03-16T03:12:18Z","title":"OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T21:00:05.911327Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2603.14771"},"observation_digest":"sha256:c7cdb2de577c9ce70f541697282d16fea8f31241cc36a9ae6fa1a75f4689c875","observation_id":"3bf352c4-3f33-44a0-9224-6a15da628d5a","resolution":{"observed_at":"2026-07-14T21:00:05.911327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2604.14116","last_updated":"2026-04-22T07:33:13Z","snapshot_observed_at":"2026-08-12T21:10:39.427401Z","submitted_at":"2026-04-15T17:38:06Z","title":"TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T12:34:29.808503Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2604.14116"},"observation_digest":"sha256:9d28de89d19f21fc93e66119a5ded064860101d9738fdfbdc32f2816f9eba9fe","observation_id":"88755ec6-6b79-4c94-94c8-2e215a67053b","resolution":{"observed_at":"2026-05-11T11:46:34.990899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2604.17406","last_updated":"2026-07-01T09:10:53Z","snapshot_observed_at":"2026-08-16T12:13:20.421267Z","submitted_at":"2026-04-19T12:26:05Z","title":"EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:59:01.010437Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2604.17406"},"observation_digest":"sha256:1873b4e44a111fbaf64394eb3249f3dcbee6692890eb52dd9b4051481bb2175a","observation_id":"512bc90b-06e6-4d78-9603-fd06ed6e08fb","resolution":{"observed_at":"2026-05-10T06:01:13.389705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2604.17406","last_updated":"2026-07-01T09:10:53Z","snapshot_observed_at":"2026-08-16T12:13:20.421267Z","submitted_at":"2026-04-19T12:26:05Z","title":"EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-05T17:45:55.631459Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2604.17406"},"observation_digest":"sha256:6bddaacd7f7c53f0c4ff03d733a0b88c71f589970d5406f1fe6d3c6821f84145","observation_id":"eb0aac0c-7f63-4c95-9f21-f7fb03cd1434","resolution":{"observed_at":"2026-07-05T17:51:14.762793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2604.18805","last_updated":"2026-04-20T20:23:42Z","snapshot_observed_at":"2026-08-11T12:30:36.819624Z","submitted_at":"2026-04-20T20:23:42Z","title":"AI scientists produce results without reasoning scientifically","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T03:56:34.581133Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2604.18805"},"observation_digest":"sha256:d3378605f3003c82d932c9ca3bef5eaafa4947be5424b408bdf979dd36c709a6","observation_id":"e3d50f7d-c52f-4211-b7dd-ab70da14f2fd","resolution":{"observed_at":"2026-05-11T12:16:07.053196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.03808","last_updated":"2026-05-05T14:35:47Z","snapshot_observed_at":"2026-08-15T04:58:20.105540Z","submitted_at":"2026-05-05T14:35:47Z","title":"Agentic-imodels: Evolving agentic interpretability tools via autoresearch","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:43.371592Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.03808"},"observation_digest":"sha256:920b8c3a1c2fad878bf9b49b55d35551da9e50f72ec8a1e86570c16c8faaf2f8","observation_id":"008b456a-fafd-4dc0-bca1-ff4fbf8f2be5","resolution":{"observed_at":"2026-05-11T23:36:36.314009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.04375","last_updated":"2026-05-16T14:48:40Z","snapshot_observed_at":"2026-08-16T17:21:49.564488Z","submitted_at":"2026-05-06T00:50:34Z","title":"Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T17:28:41.217810Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.04375"},"observation_digest":"sha256:ee558f3164c7b27af6971b69e7876d5b7c62a3a0731d2928ca9558b4455491d3","observation_id":"7db4a2ba-ff3c-4566-88de-01bd7160842b","resolution":{"observed_at":"2026-05-11T17:31:07.935615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.04375","last_updated":"2026-05-16T14:48:40Z","snapshot_observed_at":"2026-08-16T17:21:49.564488Z","submitted_at":"2026-05-06T00:50:34Z","title":"Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-21T00:13:07.546472Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.04375"},"observation_digest":"sha256:bc5fccd069ea856a39760456ce2b524c16d956952aa41ebbb2ef2522d0a2bd64","observation_id":"d1d1eb3b-a264-41a7-9589-301092f1dc7f","resolution":{"observed_at":"2026-05-21T00:13:52.856073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.11269","last_updated":"2026-05-11T21:47:22Z","snapshot_observed_at":"2026-08-12T19:42:34.550525Z","submitted_at":"2026-05-11T21:47:22Z","title":"gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:14:48.091245Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.11269"},"observation_digest":"sha256:319ff1f816e2e1dd43c00e37f696a2cf188267059923d9f24b7f1a4dd246261a","observation_id":"bd5541f9-db46-4f0e-9f26-4ed70b4ec7d4","resolution":{"observed_at":"2026-05-13T02:17:06.419263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.12808","last_updated":"2026-05-14T01:55:46Z","snapshot_observed_at":"2026-08-14T06:40:13.670571Z","submitted_at":"2026-05-12T23:00:18Z","title":"Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T20:23:34.514071Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.12808"},"observation_digest":"sha256:9b031c93fc68a9ce0c614efbf5829c00c58e16e98c07366991141f9d9fe12ee5","observation_id":"7c24fc5b-fbc7-401a-8e85-214ee5d8e4b9","resolution":{"observed_at":"2026-05-14T20:42:59.091537Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.12808","last_updated":"2026-05-14T01:55:46Z","snapshot_observed_at":"2026-08-14T06:40:13.670571Z","submitted_at":"2026-05-12T23:00:18Z","title":"Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T04:51:17.519200Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.12808"},"observation_digest":"sha256:44350faed1c8341c0d405d009314044c9e540f881b4951fd1f8f24c6beb2779f","observation_id":"f9d3a9a8-70bf-4e06-8679-25a5b4d2b280","resolution":{"observed_at":"2026-05-15T04:55:04.185995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.14033","last_updated":"2026-05-13T18:46:17Z","snapshot_observed_at":"2026-08-04T07:02:33.753832Z","submitted_at":"2026-05-13T18:46:17Z","title":"Sheaf-Theoretic Transport and Obstruction for Detecting Scientific Theory Shift in AI Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T05:45:13.652112Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.14033"},"observation_digest":"sha256:9e4442cf24e005cae36cc5b01626f99feb2647558c70c4a7d30191827d1b9b5e","observation_id":"d9150b61-a096-4425-8ef3-c022481c9690","resolution":{"observed_at":"2026-05-15T05:49:48.155452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.16616","last_updated":"2026-05-15T20:35:32Z","snapshot_observed_at":"2026-08-16T06:46:32.334621Z","submitted_at":"2026-05-15T20:35:32Z","title":"MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T19:59:40.519962Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.16616"},"observation_digest":"sha256:a461fdf21c6fa3b459a72f38ffd362c2fc3c7d13dfbb573a35a096cf84f40dda","observation_id":"9ae8b600-47c5-42ad-9d29-ecefac5a3aa4","resolution":{"observed_at":"2026-05-20T20:03:44.130932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.17373","last_updated":"2026-05-29T04:24:32Z","snapshot_observed_at":"2026-08-15T09:26:02.151681Z","submitted_at":"2026-05-17T10:30:38Z","title":"FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T14:25:15.565386Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.17373"},"observation_digest":"sha256:1b6a7eb1845710763ea11e3c09a3b3fdc7d99b0f187cdd602ac9a636f279828c","observation_id":"4d64616a-0ed4-4864-8077-eb79813f0a3a","resolution":{"observed_at":"2026-05-20T14:28:21.416859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.17373","last_updated":"2026-05-29T04:24:32Z","snapshot_observed_at":"2026-08-15T09:26:02.151681Z","submitted_at":"2026-05-17T10:30:38Z","title":"FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T19:00:30.961402Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.17373"},"observation_digest":"sha256:8786970ea39860c5f39922aa9d3b50bf2e914d9fd199821b19eaf2b23db7ceb2","observation_id":"6c4e6d4f-f2e8-47be-8365-17f4c87e9d6a","resolution":{"observed_at":"2026-06-30T19:05:00.919428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.18630","last_updated":"2026-05-18T16:34:45Z","snapshot_observed_at":"2026-08-15T15:54:08.065121Z","submitted_at":"2026-05-18T16:34:45Z","title":"SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T10:36:09.724234Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.18630"},"observation_digest":"sha256:4c2b69cc75cdf2d50655c5f866025f559d3006f674f8bb8f1f6ea44a9bb5af69","observation_id":"b816edfd-d501-41f4-a7d6-3f0852dfaea2","resolution":{"observed_at":"2026-05-20T10:38:12.174291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2605.19156","last_updated":"2026-05-18T22:20:33Z","snapshot_observed_at":"2026-08-15T00:50:05.932495Z","submitted_at":"2026-05-18T22:20:33Z","title":"How Far Are We From True Auto-Research?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-20T09:56:16.160551Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2605.19156"},"observation_digest":"sha256:18700d2bab6cf246ac5833550151f9af9eee5ea164b39ad87dac0053a800435e","observation_id":"f05f4a13-68ad-4357-8163-5a251d1de504","resolution":{"observed_at":"2026-05-20T09:58:11.275989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.02258","last_updated":"2026-06-01T13:45:18Z","snapshot_observed_at":"2026-08-02T16:51:34.074966Z","submitted_at":"2026-06-01T13:45:18Z","title":"Matter to Mechanism: A Benchmark for AI Co-Scientists in Materials and Battery Research","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T12:08:10.552789Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.02258"},"observation_digest":"sha256:b28aaef74dac65e466205a3b0fa995eb38d7d9c2d7c9896124627458af3f255f","observation_id":"64537fce-d2f5-4113-82fb-612ab3852546","resolution":{"observed_at":"2026-06-28T12:12:07.893078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.09550","last_updated":"2026-06-08T14:29:40Z","snapshot_observed_at":"2026-08-13T02:09:33.292917Z","submitted_at":"2026-06-08T14:29:40Z","title":"InquiTree: Evaluating AI Agents in the Scientific Inquiry Loop with Paper-Derived Research Trees","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T14:06:59.471772Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.09550"},"observation_digest":"sha256:b581046667f8ca7bd09ebb32e80d448e65cc20b22e7d52648332880f40f96a8a","observation_id":"f4bb8ced-03cd-4618-af61-ea1daf4023b1","resolution":{"observed_at":"2026-07-03T04:07:37.268768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.09774","last_updated":"2026-06-25T18:32:21Z","snapshot_observed_at":"2026-08-15T09:16:04.712900Z","submitted_at":"2026-06-08T17:35:17Z","title":"Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T16:14:26.278017Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.09774"},"observation_digest":"sha256:6131c933872129c5447eb95080c38c5f81801776a3d0f527f5f7bced09c5b3c7","observation_id":"eec0945f-3e54-43de-a0ad-010904ff15c6","resolution":{"observed_at":"2026-07-03T01:47:32.158536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.09774","last_updated":"2026-06-25T18:32:21Z","snapshot_observed_at":"2026-08-15T09:16:04.712900Z","submitted_at":"2026-06-08T17:35:17Z","title":"Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T05:25:29.078764Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.09774"},"observation_digest":"sha256:57d599253783deb776d3cc68a6736a094b8eeb65722c4ee29f78eb11742cff3a","observation_id":"2584bc5b-0ca1-4b18-8b8b-281f88b05362","resolution":{"observed_at":"2026-06-29T15:23:33.009993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.11176","last_updated":"2026-06-09T17:51:55Z","snapshot_observed_at":"2026-08-04T10:02:13.493460Z","submitted_at":"2026-06-09T17:51:55Z","title":"Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:43:02.919248Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.11176"},"observation_digest":"sha256:b830685a4b97c09cd20ead13b6f45ef270da8219b0be6854a6d3fad92fabba61","observation_id":"56fd1037-0225-4f58-8cd5-8a890818a602","resolution":{"observed_at":"2026-07-03T04:37:37.774873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.11926","last_updated":"2026-06-10T10:57:05Z","snapshot_observed_at":"2026-08-09T20:13:04.512653Z","submitted_at":"2026-06-10T10:57:05Z","title":"Toward Generalist Autonomous Research via Hypothesis-Tree Refinement","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-06-27T09:34:41.800309Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.11926"},"observation_digest":"sha256:e25c8008cd276fbfc1bbee256cc49ba55ee51a2a0355a25d00c411466804722d","observation_id":"de9f9559-3f59-4240-9449-302bfad1419c","resolution":{"observed_at":"2026-06-27T09:40:47.024579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:19.028507Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.15932"},"observation_digest":"sha256:b090b72869ab1b1bfd18328a74e4e9f62a9d13a1bd7eb36918aa6c05b81e0bd6","observation_id":"5e743964-8983-4ece-a96c-7cb1ab00d7b8","resolution":{"observed_at":"2026-07-03T17:38:44.063091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.17041","last_updated":"2026-07-26T05:58:56Z","snapshot_observed_at":"2026-08-02T11:08:43.878682Z","submitted_at":"2026-06-15T17:56:41Z","title":"MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:48:51.497061Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.17041"},"observation_digest":"sha256:c8467c4db1e2eaebe493ffa8db507475ae73bab6ec95b9ea6768932f9b5bf2ec","observation_id":"bd4861ec-7298-450a-83f5-50c4d597d14e","resolution":{"observed_at":"2026-07-03T17:48:45.699996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.17041","last_updated":"2026-07-26T05:58:56Z","snapshot_observed_at":"2026-08-02T11:08:43.878682Z","submitted_at":"2026-06-15T17:56:41Z","title":"MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:23:03.764108Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.17041"},"observation_digest":"sha256:97c655e1f7221b7ad47e943e63f5ad8b22cdd0adaab0c6a7b69f27f07f2d2be2","observation_id":"7a4b9f53-6523-4f29-94fa-10146fbcdeeb","resolution":{"observed_at":"2026-06-30T11:54:38.905083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.17041","last_updated":"2026-07-26T05:58:56Z","snapshot_observed_at":"2026-08-02T11:08:43.878682Z","submitted_at":"2026-06-15T17:56:41Z","title":"MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T22:05:37.948336Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.17041"},"observation_digest":"sha256:698b93180797abd244b0e6a14ceb62daa45e4e6776b0fed109208190ad809241","observation_id":"cc54a9da-76af-46ac-abc7-ab3a7a9f9119","resolution":{"observed_at":"2026-07-02T22:07:25.722606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-02T11:08:45.071671Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17041","last_updated":"2026-07-26T05:58:56Z","snapshot_observed_at":"2026-08-02T11:08:43.878682Z","submitted_at":"2026-06-15T17:56:41Z","title":"MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T11:08:45.071671Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.17041"},"observation_digest":"sha256:b4baf293232e86a3498add4a86832c2e6403c178e97d97014cd7d401abc74934","observation_id":"20aa0762-abaa-4548-a728-44d9794ff469","resolution":{"observed_at":"2026-08-02T11:08:45.071671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.17628","last_updated":"2026-06-16T07:33:53Z","snapshot_observed_at":"2026-08-05T17:08:33.405254Z","submitted_at":"2026-06-16T07:33:53Z","title":"OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-27T01:07:49.603969Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.17628"},"observation_digest":"sha256:f2bc6edfcff9f17fb8268a7e17c6d849d74433cf3b2acb69daf93b8d65d6d4b8","observation_id":"ffaa95bd-4fa8-4215-a572-169e113bc2a2","resolution":{"observed_at":"2026-07-03T20:48:56.358749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.18356","last_updated":"2026-06-16T18:04:45Z","snapshot_observed_at":"2026-08-15T23:12:53.362317Z","submitted_at":"2026-06-16T18:04:45Z","title":"SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T23:40:53.439549Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.18356"},"observation_digest":"sha256:33ab922269aed7449a5cc82950927f60cb7f164c76b609123eda8c581b871ccf","observation_id":"97ae98a8-5aca-4e41-8377-b824b5aae258","resolution":{"observed_at":"2026-07-03T22:18:59.717212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.18648","last_updated":"2026-06-23T03:11:08Z","snapshot_observed_at":"2026-08-12T14:16:02.818023Z","submitted_at":"2026-06-17T03:32:06Z","title":"Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T19:17:17.373463Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.18648"},"observation_digest":"sha256:79d7435ad10b91aa990d753b70d126b0710389a1b55b0e2baba58c6a932334c6","observation_id":"4ebafdfb-d718-4a22-906d-22d78ff414fc","resolution":{"observed_at":"2026-07-04T02:49:24.272487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.20475","last_updated":"2026-06-18T16:54:25Z","snapshot_observed_at":"2026-08-17T00:46:48.934209Z","submitted_at":"2026-06-18T16:54:25Z","title":"Marginal Advantage Accumulation for Memory-Driven Agent Self-Evolution","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T17:45:49.272070Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.20475"},"observation_digest":"sha256:2802efbe1cda0ad6e9f6dd858c3159a5b425c22558325c229e8fcdae6f344538","observation_id":"44d78091-2566-498b-b749-93971a525d1a","resolution":{"observed_at":"2026-07-04T03:39:30.801028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2606.26346","last_updated":"2026-06-24T19:38:21Z","snapshot_observed_at":"2026-08-12T11:25:18.319640Z","submitted_at":"2026-06-24T19:38:21Z","title":"How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:10.103638Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2606.26346"},"observation_digest":"sha256:d73ad2c82e6381289a46e3c665fa554ac4c79d2ffcfa454835c0d9d6c2cc5d7e","observation_id":"39f1b902-6d5b-4f37-bece-6c0a835556e3","resolution":{"observed_at":"2026-07-04T15:29:56.683593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2410.05080","doi":"10.48550/arxiv.2410.05080","metadata_source":"pith","pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":"cs.CL","work_id":"e1160394-4fe6-4475-9753-e69ad39fb09e","year":2024},"citing_paper":{"arxiv_id":"2607.07663","last_updated":"2026-07-08T17:19:50Z","snapshot_observed_at":"2026-08-12T14:05:29.940431Z","submitted_at":"2026-07-08T17:19:50Z","title":"Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops","version":1},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-07-09T03:36:57.168246Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2607.07663"},"observation_digest":"sha256:6bffa61bf38ec00c059f04528ec9131693c968b08d7f1365fd49932dc192ba04","observation_id":"6aca5516-39b5-4cb5-a91b-53c26b4307a6","resolution":{"observed_at":"2026-07-09T03:45:55.719982Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:21.375775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-07-13T00:55:17.107245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09025","last_updated":"2026-07-10T01:09:38Z","snapshot_observed_at":"2026-08-12T22:48:32.152188Z","submitted_at":"2026-07-10T01:09:38Z","title":"Evolutionary Intelligence for Scientific Discovery: From Evolutionary Computation to Cumulative Discovery Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T00:55:17.107245Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2607.09025"},"observation_digest":"sha256:f1a3ddb3eb3e2c358ea2f0c405f00cf04943af885766dd97ff3f004196e8b21e","observation_id":"ebd57547-9138-42c3-9bcf-b982a4fac180","resolution":{"observed_at":"2026-07-13T00:55:17.107245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-07-14T09:17:00.467000Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10789","last_updated":"2026-07-12T14:42:57Z","snapshot_observed_at":"2026-08-14T16:11:41.485356Z","submitted_at":"2026-07-12T14:42:57Z","title":"Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T09:17:00.467000Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2607.10789"},"observation_digest":"sha256:806ec7ca921107a410f8d5a21d8d85ea39775f975bb371047ebc5c7ded8d50b7","observation_id":"f3b9591a-9c4c-4707-b2a8-8863478fcf5e","resolution":{"observed_at":"2026-07-14T09:17:00.467000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-01T13:28:32.903465Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19104","last_updated":"2026-07-21T13:46:52Z","snapshot_observed_at":"2026-08-14T22:38:37.899347Z","submitted_at":"2026-07-21T13:46:52Z","title":"SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:28:32.903465Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2607.19104"},"observation_digest":"sha256:b3aef5372f05c94d40a2b58d8d78fdb43b89de8d0411bce30afe77661d507d5b","observation_id":"8c12ae4c-2cc0-45c9-bd76-b4e32ef82e35","resolution":{"observed_at":"2026-08-01T13:28:32.903465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-01T15:02:37.896688Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28098","last_updated":"2026-07-29T05:08:21Z","snapshot_observed_at":"2026-08-14T16:35:27.279715Z","submitted_at":"2026-07-29T05:08:21Z","title":"SciDataSailor: Deep Scientific Data Exploring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:02:37.896688Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2607.28098"},"observation_digest":"sha256:0b212a878e43482ed3a18cb7fdcff65bccc7b5be4196131a691fa8ea40961f3b","observation_id":"487e51cc-4ac0-47cd-a22e-49062cd04b05","resolution":{"observed_at":"2026-08-01T15:02:37.896688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05080","snapshot_observed_at":"2026-08-05T16:49:30.068458Z","title":"Sci- enceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery.arXiv preprint arXiv:2410.05080,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03569","last_updated":"2026-08-04T12:30:13Z","snapshot_observed_at":"2026-08-14T15:59:06.730843Z","submitted_at":"2026-08-04T12:30:13Z","title":"Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:49:30.068458Z"},"links":{"cited_paper":"/paper/2410.05080","citing_paper":"/paper/2608.03569"},"observation_digest":"sha256:f4e76f6ba8c8879aaeabbbe104078f2add614e7a1babc9d02e890238736772d4","observation_id":"a3ab6b94-0a2d-4abd-b2ed-7c5c83063fe8","resolution":{"observed_at":"2026-08-05T16:49:30.068458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.05080/citation-record","integrity":"/paper/2410.05080/integrity","json":"/paper/2410.05080/citation-record.json","paper":"/paper/2410.05080"},"outbound":[],"paper":{"arxiv_id":"2410.05080","last_updated":"2025-03-31T14:39:44Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:11:53.516904Z","submitted_at":"2024-10-07T14:33:50Z","title":"ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 67 inbound Pith citation observations for arXiv:2410.05080."}