{"as_of":"2026-08-09T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17475f49f85a2419a9ffb5ecff8d64dbf990e52bb4e21d3627ea671aa2158037","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:21:20.656965Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:19:04.202588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:08:43.128824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09321","snapshot_observed_at":"2026-08-03T02:57:46.718690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03322","last_updated":"2026-07-31T08:12:53Z","snapshot_observed_at":"2026-08-06T10:49:25.218764Z","submitted_at":"2026-02-10T05:47:22Z","title":"Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:46.718690Z"},"links":{"cited_paper":"/paper/2509.09321","citing_paper":"/paper/2603.03322"},"observation_digest":"sha256:6a6bd653c2d2b52ccb40adc778e3258aa8c3ead7b6e2d366156306b7e5324047","observation_id":"83bb601f-f2dc-4200-ba0d-534fbcd87854","resolution":{"observed_at":"2026-08-03T02:57:46.718690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"cited_work":{"arxiv_id":"2509.09321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09321","snapshot_observed_at":"2026-07-03T17:08:43.128824Z","title":"To- wards adaptive ml benchmarks: Web-agent-driven construction, domain expansion, and metric optimization,","venue":null,"work_id":"85a48350-374a-4ae1-b6b8-a9bbe0db4b6f","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-08-09T13:51:27.423274Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2509.09321","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d591ed15fd938135922ab25176a09ee4b648c354fd9a199d9bbdde8f32945b61","observation_id":"ac74188f-114d-418d-97c0-6dd30932082b","resolution":{"observed_at":"2026-07-03T17:08:43.130648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09321","snapshot_observed_at":"2026-08-04T07:19:04.202588Z","title":"Towards adaptive ML benchmarks: Web-agent-driven construction, domain expansion, and metric optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02444","last_updated":"2026-08-03T16:22:51Z","snapshot_observed_at":"2026-08-08T07:42:09.459367Z","submitted_at":"2026-08-03T16:22:51Z","title":"ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T07:19:04.202588Z"},"links":{"cited_paper":"/paper/2509.09321","citing_paper":"/paper/2608.02444"},"observation_digest":"sha256:657dc23e9fa5dc1a27c7c8e1fe9a84c69ea0af87072dd337ab83497fae4d16c8","observation_id":"c77656e4-d561-4551-af1c-1a4ce5632115","resolution":{"observed_at":"2026-08-04T07:19:04.202588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09321/citation-record","integrity":"/paper/2509.09321/integrity","json":"/paper/2509.09321/citation-record.json","paper":"/paper/2509.09321"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T19:21:20.617362Z","title":"arXiv:2412.19437","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.617362Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:c429505431f50d374198f02553704238bafd5e552f897555e1df3872caf64b05","observation_id":"47be8e18-2e3d-4eff-a005-713060cace01","resolution":{"observed_at":"2026-08-04T19:21:20.617362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:21:20.652518Z","title":"Based on thebest solution.pyand the special instructionfield, we apply an LLM-as-judge method","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.652518Z"},"links":{"citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:366ded0388e08d532c11164828a0aa36bfd4094b807060e8e60439494b757ead","observation_id":"0c1fd238-f871-4ab2-8b44-2a48fd10c74a","resolution":{"observed_at":"2026-08-04T19:21:20.652518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23278","snapshot_observed_at":"2026-08-04T19:21:20.625233Z","title":"arXiv:2503.23278","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.625233Z"},"links":{"cited_paper":"/paper/2503.23278","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:1913d4fb7768ac3f6fdc490455ae62be1cfc866ba519e11c9dae5b193749bca6","observation_id":"e1b0b085-c7ee-4717-aafa-2f5efa5e9772","resolution":{"observed_at":"2026-08-04T19:21:20.625233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03302","last_updated":"2024-04-14T21:02:16Z","snapshot_observed_at":"2026-08-03T01:30:37.931398Z","submitted_at":"2023-10-05T04:06:12Z","title":"MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03302","snapshot_observed_at":"2026-08-04T19:21:20.629076Z","title":"arXiv:2310.03302","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.629076Z"},"links":{"cited_paper":"/paper/2310.03302","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:d2e078efefb6f385f94681cf7131c20959ac4bbd1213b343e9711d1477d494b6","observation_id":"227d29d8-f707-437a-8499-71de11a6b9e8","resolution":{"observed_at":"2026-08-04T19:21:20.629076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-04T19:21:20.632584Z","title":"arXiv:2502.13138","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.632584Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:ba9e87456209b67704856544ab5a19b76f66edfd3df07e07bbd8cb51e70851cb","observation_id":"3108a0c6-682c-41e6-81c6-1097e8878488","resolution":{"observed_at":"2026-08-04T19:21:20.632584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:21:20.636967Z","title":"https://openai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.636967Z"},"links":{"citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:c50b827dcaec7955e29b859aa67a4e5e88b4b1d27bd86655ff30856e20110f16","observation_id":"4cbe0489-1d73-4c7c-95f9-bff113c376f8","resolution":{"observed_at":"2026-08-04T19:21:20.636967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:21:20.640845Z","title":"arXiv:2506.10974","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.640845Z"},"links":{"citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:91ddad06e13f621e8e3474cc7671c481eec8a2bebfd12f218ce67ca25451aab5","observation_id":"c8745975-a680-4800-ab74-c32d932b8cb5","resolution":{"observed_at":"2026-08-04T19:21:20.640845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-04T19:21:20.644500Z","title":"arXiv:2407.16741","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.644500Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:2d8a7d29b7989ad603103a3c53f5976144c905361f1d8986771d6f4452db255b","observation_id":"0e597af1-c846-4930-8e80-0df76d12aebf","resolution":{"observed_at":"2026-08-04T19:21:20.644500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:21:20.656965Z","title":"A dash (“-”) indicates that nosubmission.csvwas generated or the generated file failed to meet the required format for evaluation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.656965Z"},"links":{"citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:bb5a0e6a733695494478636d5ab9017bec2992678fd57724a2ca3d38089f34c7","observation_id":"d546f07d-c57c-410d-8f82-3cd9487f3cc8","resolution":{"observed_at":"2026-08-04T19:21:20.656965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T19:21:20.648156Z","title":"task_type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.648156Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:3b0f19deb89adf56193b315627a42ac1822d741f69d8c9a4b87945dc318ff9e7","observation_id":"a64d702a-bb40-4664-8400-a711ddc705c5","resolution":{"observed_at":"2026-08-04T19:21:20.648156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00566","last_updated":"2024-02-18T01:24:17Z","snapshot_observed_at":"2026-08-05T11:50:58.369418Z","submitted_at":"2023-10-01T03:50:34Z","title":"Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00566","snapshot_observed_at":"2026-08-04T19:21:20.621399Z","title":"arXiv:2310.00566","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.621399Z"},"links":{"cited_paper":"/paper/2310.00566","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:d5eac5c10c9c87d027a3a624b40a5facb989a822716721a11beab7d7e8c1faf8","observation_id":"59f460dc-f957-45a0-9e56-290c1927528e","resolution":{"observed_at":"2026-08-04T19:21:20.621399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-04T19:21:20.611481Z","title":"arXiv:2410.07095","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T19:21:20.611481Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2509.09321"},"observation_digest":"sha256:c12cc5089cebb4c1f58197e6317fd0a3da78586b528e354ece5b18092f9eae3a","observation_id":"8efd4654-b1fb-4d81-bad9-179da1230ff3","resolution":{"observed_at":"2026-08-04T19:21:20.611481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T07:35:26.627440Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 3 inbound Pith citation observations for arXiv:2509.09321."}