{"as_of":"2026-08-09T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e80250ca3fcbb75c8643c68b2fab65e5a34bf9a30a71fad21a4f03b5d1b91084","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:25.819108Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06301/citation-record","integrity":"/paper/2608.06301/integrity","json":"/paper/2608.06301/citation-record.json","paper":"/paper/2608.06301"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.833781Z","title":null,"venue":null,"work_id":"ffe0a9df-e842-43e9-8264-492ba34ba1d7","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.616441Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:a61ce89066994f53769a885df63ba8af9c05a8e0e698ff24c9450252eb54b83a","observation_id":"7c5f7cd5-2b14-40f1-a771-e60121272912","resolution":{"observed_at":"2026-08-07T06:02:26.840406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T06:02:25.621540Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.621540Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:82ffc7181edeba3e9c512211e34fa14e716a38c236b20920bdbed41ed8ec8278","observation_id":"84c6ef51-45d5-495f-9a85-66d6b116523e","resolution":{"observed_at":"2026-08-07T06:02:25.621540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-07T06:02:25.626627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.626627Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:10ac5aae0845810183d4f196074f3071a6f7d192db654302c70eef2003d95970","observation_id":"6b862b9b-a108-44ff-b7c2-bfc126a7f381","resolution":{"observed_at":"2026-08-07T06:02:25.626627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14249","last_updated":"2026-07-23T03:12:37Z","snapshot_observed_at":"2026-08-05T08:20:08.381254Z","submitted_at":"2026-06-12T08:27:11Z","title":"HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry","version":3},"cited_work":{"arxiv_id":"2606.14249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.14249","snapshot_observed_at":"2026-08-07T06:02:26.514955Z","title":"HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry","venue":"cs.AI","work_id":"7ff193b7-9a59-4c32-9e47-a2e1efbdde7a","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.639914Z"},"links":{"cited_paper":"/paper/2606.14249","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:f5994fc8745e13b4bd8b27b5a536d813dc1924c24a50276e433a431d74328446","observation_id":"5fecd972-8608-4139-bedb-a94f5cec91d0","resolution":{"observed_at":"2026-08-07T06:02:26.542719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.818572Z","title":null,"venue":null,"work_id":"fa81733b-1892-49d6-a89a-e4ba14370f70","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.644768Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:8e989dd1a9bd30cd951952cf8c4c4ee4f26301a362563c198446d5845bef64e7","observation_id":"06ae2d74-049d-4f54-a113-92f478ceaf97","resolution":{"observed_at":"2026-08-07T06:02:26.823414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16218","last_updated":"2024-11-01T00:01:01Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-23T21:05:31Z","title":"Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16218","snapshot_observed_at":"2026-08-07T06:02:25.649833Z","title":"Cheng, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.649833Z"},"links":{"cited_paper":"/paper/2406.16218","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:64ee2c4f8bd2248e9f3f17d0f189ae5091ab5a55e6602ad31c798e66b053f8e2","observation_id":"7e24c6bc-e978-4394-a654-b4a3c2cfc91a","resolution":{"observed_at":"2026-08-07T06:02:25.649833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.655395Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.655395Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:aa119143d7ceb0558bfa03fba9455dd00050f49fd87dbe6ff63136a3d0362322","observation_id":"1ad6944b-e18e-41d3-b5e1-095ed755382e","resolution":{"observed_at":"2026-08-07T06:02:25.655395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.787871Z","title":null,"venue":null,"work_id":"7bd44557-0b86-4880-8b11-f031b6688d00","year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.659935Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5cbc7e8df18fa10eefb3f2123fb88f05027fed3a8f212444e35c0f4f1ce9cee3","observation_id":"4e70b33f-ef19-4b64-b8e2-73e9f5469edd","resolution":{"observed_at":"2026-08-07T06:02:26.792632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-07T06:02:25.668797Z","title":"Khattab, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.668797Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:baadd0f38a81f350279b752d5a0570223bfb7cb7b84e90294b9de598ef2c622c","observation_id":"95aa86d1-88d4-415c-97c5-7a24d9379dfd","resolution":{"observed_at":"2026-08-07T06:02:25.668797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19349","last_updated":"2025-09-17T17:49:02Z","snapshot_observed_at":"2026-08-08T12:04:51.587933Z","submitted_at":"2025-09-17T17:49:02Z","title":"ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.19349","snapshot_observed_at":"2026-08-07T06:02:25.673512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.673512Z"},"links":{"cited_paper":"/paper/2509.19349","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:b091f4fb86784be27540f3dce90b945c73e2b8fbf28857af01d8a86bd241203c","observation_id":"72497daf-5131-42b4-be49-78a98649a566","resolution":{"observed_at":"2026-08-07T06:02:25.673512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-08-07T21:46:16.930745Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-07T06:02:25.678912Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.678912Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:3457e69fb230d680a5b01b5e8aca831de6d6003e1a4bbb7115d3f4c68d0e2bb4","observation_id":"b114c3e1-3999-451f-90ca-dd70996b620e","resolution":{"observed_at":"2026-08-07T06:02:25.678912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25850","last_updated":"2026-05-18T15:11:47Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T16:55:02Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25850","snapshot_observed_at":"2026-08-07T06:02:25.684162Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.684162Z"},"links":{"cited_paper":"/paper/2604.25850","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5d8392a551febecd610024ddc91de1e879c512a804fb5ebbae6d4a3f78d725db","observation_id":"45050dee-36a5-4044-bb03-177129addcc5","resolution":{"observed_at":"2026-08-07T06:02:25.684162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.25886","last_updated":"2026-07-28T15:46:41Z","snapshot_observed_at":"2026-08-07T09:45:34.637759Z","submitted_at":"2026-07-28T15:46:41Z","title":"RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.25886","snapshot_observed_at":"2026-08-07T06:02:25.689165Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.689165Z"},"links":{"cited_paper":"/paper/2607.25886","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:7285be8449187b4e6d6b29eb7723f05b385f87c4529da52823234f30e05c9454","observation_id":"59ab5bed-bff7-4a79-bee9-45284fe28a2e","resolution":{"observed_at":"2026-08-07T06:02:25.689165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-07T06:02:25.694406Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.694406Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:05311ab3ee41ab2a240b7634c232bb607f443da8269f8aec70e23991d2360dae","observation_id":"7a5ea708-3a4e-48e5-a781-7d8f087d9d65","resolution":{"observed_at":"2026-08-07T06:02:25.694406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-07T06:02:25.699110Z","title":"Mialon, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.699110Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:0245e56646320182b3be371bb9ad94abde07ec6fd0fad34731fa62f544d3115c","observation_id":"832e847c-45be-4983-ae0d-e267fdca825c","resolution":{"observed_at":"2026-08-07T06:02:25.699110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-07T04:21:43.190472Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-07T06:02:25.704618Z","title":"Novikov, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.704618Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:bc29945c6a0bd2bd689f3ea487b7b530eceb573ca06323ebf3773089d02b0aad","observation_id":"ac423a22-3cfe-41b3-918c-a10db151494c","resolution":{"observed_at":"2026-08-07T06:02:25.704618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.710081Z","title":"Opsahl-Ong, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.710081Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:1be63592aa7311e73555b01ccd6ad1e76b6a5efde67d35d3c03b1f2ccca79f49","observation_id":"6d6365fd-311e-4770-9698-675129b7400d","resolution":{"observed_at":"2026-08-07T06:02:25.710081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.768056Z","title":"Ouyang, S","venue":null,"work_id":"2d14fedb-b211-4bcd-a69e-124a2473e251","year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.714285Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:8a945fcf4a4bab91735371027f96c0afb8273c09b350669a5d13352293bf6901","observation_id":"ad972446-d52d-4349-a01d-73c312377a8b","resolution":{"observed_at":"2026-08-07T06:02:26.773465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.718442Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.718442Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:13633141f9c923f94b77bc470e05ea217ccc31f1c9db6b6144838b558fc2f355","observation_id":"6a3d847d-bc83-419c-ba9a-46bfdafc02e9","resolution":{"observed_at":"2026-08-07T06:02:25.718442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.731989Z","title":"Romera-Paredes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.731989Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:1b0896f49da700f3136fcb708cda203799fa55bd65612221ce7dd8cc3a32ccf6","observation_id":"f8c1677d-df60-4c64-b1d0-0381581b932d","resolution":{"observed_at":"2026-08-07T06:02:25.731989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.749683Z","title":"Ursekar, A","venue":null,"work_id":"cea1ff54-a28b-4b01-bc9c-cd049c34e488","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.736276Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:68b4249dccce7eca08da6de6f5bdaa3e0a02016ad06e0dbaac99085be1c47b92","observation_id":"72fcfa4e-52d1-4680-a932-1113a7b1aafa","resolution":{"observed_at":"2026-08-07T06:02:26.755690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.732690Z","title":null,"venue":null,"work_id":"02492c75-a73d-45e8-879a-885718471c28","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.740882Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:1b783abefa6559421ba69d8511b461e729e782bd357efe53770a010250deee2f","observation_id":"8c554198-4a8f-4996-add4-14b687b00309","resolution":{"observed_at":"2026-08-07T06:02:26.737554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.745383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.745383Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:9394da19830c874f6a20f11f600567e3f4e6f24ec258b2bf1d07f6e92399cd2e","observation_id":"6b69b85f-28e1-4de3-95f4-1ebd8cd4499e","resolution":{"observed_at":"2026-08-07T06:02:25.745383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.709432Z","title":null,"venue":null,"work_id":"69a33e2e-4e79-4355-a79c-aaa5309ab4be","year":2023},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.749972Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:a535c01b74a7f2dcd98d20316f602b9e512c6436cb12f2291df650b538ec8227","observation_id":"5957b07f-23e7-492c-bfc7-8ae6bb7b80b7","resolution":{"observed_at":"2026-08-07T06:02:26.716924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.685758Z","title":null,"venue":null,"work_id":"d691aa0b-3b5d-4909-9075-38afc0d7b196","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.754561Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:ec0eb1bc2e0288016c3603c2d90fddd4099df80bb7badb530fa24221e395b4ec","observation_id":"5cadbf08-4f74-4106-b420-6f947be9a055","resolution":{"observed_at":"2026-08-07T06:02:26.692576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-01T07:23:06.300790Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-07T06:02:25.759327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.759327Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:f4e2070af465106fd2c02900a789d099740c349963efb2b42f1964b91b534bc1","observation_id":"c3ee986a-611a-463a-941e-2e856cb77cad","resolution":{"observed_at":"2026-08-07T06:02:25.759327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.663443Z","title":null,"venue":null,"work_id":"398debcc-1e4a-4652-b6bf-c8a8600bcd97","year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.763834Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:dbcdaf94ea8f8a0750e0c231af046c05270b3de9e588244a2331ddf3e91ee41e","observation_id":"db2fe2c1-8763-4894-8e1e-9ca36870d67f","resolution":{"observed_at":"2026-08-07T06:02:26.671001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-08T22:44:44.640854Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-08-07T06:02:25.768245Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.768245Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:e74be1001d406d812f6bed047ba24dd25526cd68bddced7822efe8a9a24b950c","observation_id":"f0aa53e8-970e-4a68-b894-3261e7658649","resolution":{"observed_at":"2026-08-07T06:02:25.768245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.772900Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.772900Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5d964561c02b25e4b6c0c0f443248fee6f9d38791d44368383019f80f70c4eaf","observation_id":"07ccd406-2445-4169-8b89-6f761f2e1fb8","resolution":{"observed_at":"2026-08-07T06:02:25.772900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04444","last_updated":"2025-05-31T07:33:17Z","snapshot_observed_at":"2026-08-03T21:44:57.583731Z","submitted_at":"2024-10-06T10:49:40Z","title":"G\\\"odel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04444","snapshot_observed_at":"2026-08-07T06:02:25.787406Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.787406Z"},"links":{"cited_paper":"/paper/2410.04444","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:eb16d7a9480201e1c05d0d063a1c221e1c31b944e275bfc3fa1b76f1eaaf77aa","observation_id":"5853d2ef-5886-4c79-908a-c3d9a07ba557","resolution":{"observed_at":"2026-08-07T06:02:25.787406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-07T06:02:25.793445Z","title":"differentiation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.793445Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:7ff08bbef7a0813b001ddff163c55749a668d63eb099062fbaf3668b8a85c622","observation_id":"fd38340b-54e5-4194-bb30-b1108b5bc95d","resolution":{"observed_at":"2026-08-07T06:02:25.793445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.642320Z","title":"Zelikman, E","venue":null,"work_id":"b84c669e-4d63-460b-ac0a-a5d534dcf5af","year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.799359Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:d4b5c37418c5875106e392bffd95b30ce4bdbe362e27b1e94abb36cf3d01320a","observation_id":"8b7b2ce4-092c-41fe-8d39-6e49194a1169","resolution":{"observed_at":"2026-08-07T06:02:26.647834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16673","last_updated":"2025-01-30T16:40:12Z","snapshot_observed_at":"2026-08-06T08:29:39.486028Z","submitted_at":"2025-01-28T03:18:48Z","title":"LLM-AutoDiff: Auto-Differentiate Any LLM Workflow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16673","snapshot_observed_at":"2026-08-07T06:02:25.783053Z","title":"14 Scale AI Research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.783053Z"},"links":{"cited_paper":"/paper/2501.16673","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:a28c9504eaf88184796d424d789a04ddd5dc7d8c0d3993b545c937facdb4b65a","observation_id":"fc3bd319-50f2-4c22-b079-517dfd5d96b7","resolution":{"observed_at":"2026-08-07T06:02:25.783053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.625049Z","title":"Zhang, J","venue":null,"work_id":"8a00ebce-f621-484f-a9f1-3b60d88403e7","year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.809069Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:75803265e5a421d96a46085434731e7739438f619b88a4c65635bebafe834c55","observation_id":"e86ce37a-0105-4da9-9a23-55caca814dba","resolution":{"observed_at":"2026-08-07T06:02:26.629708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23950","last_updated":"2026-05-07T15:24:59Z","snapshot_observed_at":"2026-08-03T13:44:55.519841Z","submitted_at":"2026-05-07T15:24:59Z","title":"Stop Comparing LLM Agents Without Disclosing the Harness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23950","snapshot_observed_at":"2026-08-07T06:02:25.819108Z","title":"closer together than re-running the grid moves them","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.819108Z"},"links":{"cited_paper":"/paper/2605.23950","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:30a29857a1b626d71c2bbbef02a1e8daca10089ddaba60029b5a2c6526178ee8","observation_id":"0382457f-3707-41e7-b59a-3175ac6c7b7c","resolution":{"observed_at":"2026-08-07T06:02:25.819108Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-07T06:02:25.804071Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.804071Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:728451559d8a34e426a55d76dc4fee5e3250328b427c9bfc410c2671ac93e6b7","observation_id":"73f9813b-71b4-42ab-adfc-fa76a52057a8","resolution":{"observed_at":"2026-08-07T06:02:25.804071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10762","last_updated":"2025-04-15T02:44:55Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:40:40Z","title":"AFlow: Automating Agentic Workflow Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10762","snapshot_observed_at":"2026-08-07T06:02:25.813777Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.813777Z"},"links":{"cited_paper":"/paper/2410.10762","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:529a88866f1d1af5ebd4e2269853b396db07e4e81d8d287d3b6167dde4c040cb","observation_id":"9aa97db2-102f-483b-9dd4-c900c79cfe0e","resolution":{"observed_at":"2026-08-07T06:02:25.813777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T06:02:25.635628Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.635628Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:3fb5827d6095d5c6b39468fc0de288f50ca7a28abf86f92f2ade8d1e9400c91f","observation_id":"f1e92752-39a5-4a6e-98a4-f093a899e2ea","resolution":{"observed_at":"2026-08-07T06:02:25.635628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T06:02:25.664469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.664469Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:1b3baf1226ec6f81f1f9278ad69ab141c3e80f013fa7dbaddc8e89d84d2eb307","observation_id":"234b9e0a-50f4-453b-8d80-4979d8b30ea7","resolution":{"observed_at":"2026-08-07T06:02:25.664469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15228","last_updated":"2025-05-16T20:58:56Z","snapshot_observed_at":"2026-08-07T16:00:31.124805Z","submitted_at":"2025-04-21T16:58:18Z","title":"A Self-Improving Coding Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15228","snapshot_observed_at":"2026-08-07T06:02:25.727335Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.727335Z"},"links":{"cited_paper":"/paper/2504.15228","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:44d7db1eda5f2c800ae5d51b8fd4fe747f6ec2363bb6375ba65fd66a43e1df9f","observation_id":"5ae73031-9670-42b4-b8d3-9d6859d5658e","resolution":{"observed_at":"2026-08-07T06:02:25.727335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T18:13:48.868425Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.06301."}