{"as_of":"2026-08-22T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcb951d433024854d190e49ab00e02d31d7939d658e50cafe8cde7f68600992e","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:30:04.614811Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:24:46.242048Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T12:23:24.671544Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-06T22:46:32.360665Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20803","last_updated":"2025-06-25T19:47:23Z","snapshot_observed_at":"2026-08-15T09:12:05.939215Z","submitted_at":"2025-06-25T19:47:23Z","title":"The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:32.360665Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2506.20803"},"observation_digest":"sha256:edcc1a4e938855770f04064267fcdd09f1a7efb4c1b2a060ae8d4af8b8fb7458","observation_id":"b555cb75-8a55-487b-8429-0ff88055c6cd","resolution":{"observed_at":"2026-08-06T22:46:32.360665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-06T04:51:20.803345Z","title":"Hua, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02962","last_updated":"2025-08-04T23:53:01Z","snapshot_observed_at":"2026-08-18T00:15:45.886590Z","submitted_at":"2025-08-04T23:53:01Z","title":"Robot builds a robot's brain: AI generated drone command and control station hosted in the sky","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:51:20.803345Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2508.02962"},"observation_digest":"sha256:418e868c653ef5dcbccf5fbf5f92d851bf28d6da1cecd5f2f4e5d5d9d374671b","observation_id":"46c50fdc-078a-42df-9163-041d793d16ef","resolution":{"observed_at":"2026-08-06T04:51:20.803345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-05T23:21:22.599676Z","title":"T.; Liang, W.; Sun, F.-Y.; and Haber, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05468","last_updated":"2025-08-07T15:11:17Z","snapshot_observed_at":"2026-08-16T14:04:24.623406Z","submitted_at":"2025-08-07T15:11:17Z","title":"TASE: Token Awareness and Structured Evaluation for Multilingual Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:21:22.599676Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2508.05468"},"observation_digest":"sha256:98b34500a1d56f2249e4b6b62ba0c6e5cd545cbf72e2f2b28bbdda0ad8501fdb","observation_id":"3fdb24da-5aa2-4e20-9e2d-5d85a0516e6a","resolution":{"observed_at":"2026-08-05T23:21:22.599676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2512.01089","last_updated":"2026-05-14T22:16:55Z","snapshot_observed_at":"2026-08-02T19:44:09.196813Z","submitted_at":"2025-11-30T21:19:10Z","title":"CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-21T18:15:13.924995Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2512.01089"},"observation_digest":"sha256:2e5752634a51a259563a5f999bf940a6c228976069e0e79778ed7c87ef596f60","observation_id":"8845b873-a0d6-4b73-a5a1-001b7f67e920","resolution":{"observed_at":"2026-05-21T18:15:28.008514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2602.11354","last_updated":"2026-04-09T18:26:34Z","snapshot_observed_at":"2026-08-12T23:17:52.021790Z","submitted_at":"2026-02-11T20:42:10Z","title":"ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T02:01:07.555124Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2602.11354"},"observation_digest":"sha256:063b3926c925f9ad824c19232099221e031ee5bb65dcdf3baa30faa7bb38c9b9","observation_id":"4ad5c576-5f75-422e-89b7-6473640b0e45","resolution":{"observed_at":"2026-05-16T02:02:06.935796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2604.04074","last_updated":"2026-04-07T17:20:55Z","snapshot_observed_at":"2026-08-16T01:22:08.751929Z","submitted_at":"2026-04-05T11:45:22Z","title":"FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T17:32:06.864338Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2604.04074"},"observation_digest":"sha256:7e7aabd4e2a0f6794db978a409f9deb7f82690e2414e1bc72fd54638c92718cc","observation_id":"7d50b9dd-91ab-491b-b104-8c950183688f","resolution":{"observed_at":"2026-05-13T17:33:02.271560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2604.10718","last_updated":"2026-04-12T16:28:51Z","snapshot_observed_at":"2026-08-15T11:49:03.806779Z","submitted_at":"2026-04-12T16:28:51Z","title":"SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:34.768853Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2604.10718"},"observation_digest":"sha256:cc5a8019f499135772779f86779d7fa2a28d373236941186eb6989883e08647d","observation_id":"9827d15f-5293-4b57-aa18-9223ba4c8115","resolution":{"observed_at":"2026-05-11T09:36:03.778992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2604.19606","last_updated":"2026-04-30T03:40:02Z","snapshot_observed_at":"2026-08-11T17:19:41.854749Z","submitted_at":"2026-04-21T15:55:33Z","title":"AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T02:30:39.346257Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2604.19606"},"observation_digest":"sha256:27415e0d80c736ca4a62957bb1ff6f15c9f9d43441aea350de3b405fb33d1a55","observation_id":"eabd1c0e-4c1b-4689-a89f-5ed82c8c11d7","resolution":{"observed_at":"2026-05-11T13:01:04.244734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2605.15226","last_updated":"2026-05-13T14:14:54Z","snapshot_observed_at":"2026-08-12T12:37:27.717204Z","submitted_at":"2026-05-13T14:14:54Z","title":"Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-19T17:49:01.198956Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.15226"},"observation_digest":"sha256:437e393e0a5d2a4081b90690f8876aea48978889daf3eb19c13b10e0f634f088","observation_id":"eddb464f-bb32-48c8-91c2-7cbca15f67af","resolution":{"observed_at":"2026-05-19T17:52:43.035333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2605.16616","last_updated":"2026-05-15T20:35:32Z","snapshot_observed_at":"2026-08-16T06:46:32.334621Z","submitted_at":"2026-05-15T20:35:32Z","title":"MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T19:59:40.519962Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.16616"},"observation_digest":"sha256:89508ce27b811c19e9141b2b6eb89684e8a69a87d9b652ee7e02d128c2226387","observation_id":"f78992f4-4ce3-462a-b6a9-68a132b93bb6","resolution":{"observed_at":"2026-05-20T20:03:44.142766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2605.17324","last_updated":"2026-05-17T08:30:45Z","snapshot_observed_at":"2026-08-03T01:56:42.822957Z","submitted_at":"2026-05-17T08:30:45Z","title":"ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-19T23:54:15.987953Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.17324"},"observation_digest":"sha256:78312c063ecbe29492563140b41391603cbac52de1cf1b773bc9bbf7ad76b64c","observation_id":"78d3d367-84ca-450b-bab8-24e16520e1a2","resolution":{"observed_at":"2026-05-19T23:57:53.363396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2605.18661","last_updated":"2026-07-20T17:24:03Z","snapshot_observed_at":"2026-08-19T01:19:48.793908Z","submitted_at":"2026-05-18T17:08:26Z","title":"AI for Auto-Research: Roadmap & User Guide","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T10:30:50.256635Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.18661"},"observation_digest":"sha256:51d973088827c267aae016d6a28c27021d4e1361804c8486902fac3843b44348","observation_id":"87403219-8c32-45e1-bfd6-113e90b5ff56","resolution":{"observed_at":"2026-05-20T10:33:12.684486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-02T13:43:35.697198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.18661","last_updated":"2026-07-20T17:24:03Z","snapshot_observed_at":"2026-08-19T01:19:48.793908Z","submitted_at":"2026-05-18T17:08:26Z","title":"AI for Auto-Research: Roadmap & User Guide","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T13:43:35.697198Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.18661"},"observation_digest":"sha256:96a0d53de2f864bbd90235b930bd4fd99d851c53b68b09b5d939fe6401e98e8b","observation_id":"dfaac76a-3c6a-4e6f-a532-dff57ebd65bf","resolution":{"observed_at":"2026-08-02T13:43:35.697198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":"2506.02314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-06-29T12:23:24.671544Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":"87d25587-298e-4185-97fa-87cc76a87d92","year":2025},"citing_paper":{"arxiv_id":"2605.28371","last_updated":"2026-05-27T12:11:05Z","snapshot_observed_at":"2026-08-13T06:14:13.126261Z","submitted_at":"2026-05-27T12:11:05Z","title":"From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T12:13:58.111299Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2605.28371"},"observation_digest":"sha256:ff4121ed0f81ba0936ae688fade1833205abe820f3f3811568727c950f0d6c3e","observation_id":"943dad94-76be-4e79-8e7e-ac03b93f6b2a","resolution":{"observed_at":"2026-06-29T12:23:24.672894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-02T01:00:22.372434Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14818","last_updated":"2026-07-16T10:37:02Z","snapshot_observed_at":"2026-08-18T15:09:52.534680Z","submitted_at":"2026-07-16T10:37:02Z","title":"Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-02T01:00:22.372434Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2607.14818"},"observation_digest":"sha256:2a8e8f7a76f40036817022eecb1292c4c0d84074e96e6cd1e5127d3c318d233b","observation_id":"15cc6769-5a69-4933-b731-70b6c788d4fb","resolution":{"observed_at":"2026-08-02T01:00:22.372434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-07-31T14:26:52.414276Z","title":"Truong, Weixin Liang, Fan-Yun Sun, and Nick Haber","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24459","last_updated":"2026-07-28T04:09:04Z","snapshot_observed_at":"2026-08-14T19:26:53.678177Z","submitted_at":"2026-07-27T14:01:32Z","title":"From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T14:26:52.414276Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2607.24459"},"observation_digest":"sha256:706cbedd3f5c2498f11c5905b6292c6e7db2259315ad8a0244833064ad583939","observation_id":"88708047-8690-4df7-a06e-1ca8438e43fc","resolution":{"observed_at":"2026-07-31T14:26:52.414276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02314","snapshot_observed_at":"2026-08-15T15:24:46.242048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00450","last_updated":"2026-08-04T02:35:15Z","snapshot_observed_at":"2026-08-19T01:22:14.238613Z","submitted_at":"2026-08-01T05:18:25Z","title":"Revibing Code from Papers: Reimplementing HCI Artifacts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:24:46.242048Z"},"links":{"cited_paper":"/paper/2506.02314","citing_paper":"/paper/2608.00450"},"observation_digest":"sha256:0f8e6236c5c92a624932b79ddc4b26debe92a901d2135c433eed88855b0581f6","observation_id":"63a653a7-9bd5-43ab-b6a6-5c508d9d876e","resolution":{"observed_at":"2026-08-15T15:24:46.242048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02314/citation-record","integrity":"/paper/2506.02314/integrity","json":"/paper/2506.02314/citation-record.json","paper":"/paper/2506.02314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.221282Z","title":null,"venue":null,"work_id":"73ee42df-aaea-41dc-a25e-9b9d42368361","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.158768Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:c5985148e2ea3f83ecd9346aed5d3a278d249382ab8d2624113cd97f0361a360","observation_id":"691111d9-f02b-4677-9914-91bc4770ad7d","resolution":{"observed_at":"2026-08-07T11:30:05.291244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.071197Z","title":"calculate area","venue":null,"work_id":"b7bbf5f5-4f2f-455f-b08d-99e0f90ef3bd","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.233185Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:d4f61d9fcb246b6f7e06fa5a349291d7b8b921caf9a3b446b0db9cfc27952f7d","observation_id":"2ddd7919-e2b9-479b-afd5-50c3228893df","resolution":{"observed_at":"2026-08-07T11:30:05.132937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:04.934372Z","title":null,"venue":null,"work_id":"6697046b-f958-4fc4-b24a-e764c360090c","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.285489Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:937b14e0a1cbff7da303b7d6dc7e62de3038e22102bd3fa90a09c00b0dfdc4ae","observation_id":"66794533-d14b-4e1b-9c2e-d2ffd3814057","resolution":{"observed_at":"2026-08-07T11:30:05.012101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:04.839210Z","title":"19 Here is the code that you need to complete: {context_code_str + masked_code_str} Please implement the missing code in the TODO blocks","venue":null,"work_id":"2d025caf-9311-4e8a-803e-b4cf1342233f","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.324269Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:6a148c0ea6c95c3c760aeda97280dee5ad80b04afcc43552cd6e33b3c3aacef0","observation_id":"25375523-4700-4625-b181-7f40447c8193","resolution":{"observed_at":"2026-08-07T11:30:04.891715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.770362Z","title":null,"venue":null,"work_id":"1b723f9b-c7fb-4846-93ff-51cc0a15af2f","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.386780Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:4efe37e23c0a8c5811d4e6182fa67db3398aee9569f07eb722e5be89e220f09e","observation_id":"5953f810-81cf-4204-a698-f1788d9337c7","resolution":{"observed_at":"2026-08-07T11:30:05.837972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.654587Z","title":null,"venue":null,"work_id":"0cb2b3d8-c284-4878-9f13-4e2ee4bb1398","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.444609Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:80d02ececee9c8ce22d5bc6440cdfc719420a5a1c4d696c248023f3b66ee4d79","observation_id":"89d98f07-0444-41d4-9ab2-b95c1ec61730","resolution":{"observed_at":"2026-08-07T11:30:05.730723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.497910Z","title":null,"venue":null,"work_id":"a0899f0e-abab-4a09-bbde-a9c988761fc3","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.490287Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:52d706a4468a6a1f4149b4a70721d131d42e04856d0242e7bb5050f863200367","observation_id":"c8fcdc46-aa79-4c0b-929c-710df3a816f8","resolution":{"observed_at":"2026-08-07T11:30:05.570551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:05.378813Z","title":null,"venue":null,"work_id":"ff682279-72c4-4967-a9ad-2d595436d9de","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.567217Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:68c5dfb630d76dbcadea617849d046e00c452da069101d9d960a8590bb9254d0","observation_id":"8074b593-43c7-4a83-a570-8071abf0a365","resolution":{"observed_at":"2026-08-07T11:30:05.437871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:04.727993Z","title":null,"venue":null,"work_id":"11a830ad-65b0-479f-abc5-a162146a5c90","year":null},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:04.614811Z"},"links":{"citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:8db95399f9d6fee42ee2f09bef254e83103e4924da76c14e440979680f91f269","observation_id":"5825ffe0-a1f3-4f1c-af74-b36e3b47bd51","resolution":{"observed_at":"2026-08-07T11:30:04.772792Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12468","last_updated":"2026-05-27T05:13:38Z","snapshot_observed_at":"2026-08-16T12:57:30.018532Z","submitted_at":"2025-02-18T02:55:48Z","title":"MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12468","snapshot_observed_at":"2026-08-07T11:30:03.875329Z","title":"snippets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":1118,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:03.875329Z"},"links":{"cited_paper":"/paper/2502.12468","citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:5ec92d6bf54f5165f5da09379b2ce19e5570652ec3862499b650ee8cb24e16b0","observation_id":"f75f7814-d361-42b0-a987-39bff45af3f1","resolution":{"observed_at":"2026-08-07T11:30:03.875329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02150","last_updated":"2024-05-03T14:56:43Z","snapshot_observed_at":"2026-08-19T20:03:48.054783Z","submitted_at":"2024-05-03T14:56:43Z","title":"The AI Review Lottery: Widespread AI-Assisted Peer Reviews Boost Paper Scores and Acceptance Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02150","snapshot_observed_at":"2026-08-07T11:30:03.829875Z","title":"Giuseppe Russo Latona, Manoel Horta Ribeiro, Tim R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:30:03.829875Z"},"links":{"cited_paper":"/paper/2405.02150","citing_paper":"/paper/2506.02314"},"observation_digest":"sha256:f2f535b17fef14bc24eb14817b0d8d0fe0986eabe2fd97992b7a2237eafc455d","observation_id":"b3a50432-2799-4222-8072-24ab5db5925e","resolution":{"observed_at":"2026-08-07T11:30:03.829875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02314","last_updated":"2025-06-02T23:04:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T17:40:27.870689Z","submitted_at":"2025-06-02T23:04:12Z","title":"ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 17 inbound Pith citation observations for arXiv:2506.02314."}