{"as_of":"2026-08-10T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f276d20b96c0757ee070a0fceb818fee88393d4523a36a4633a2be07d1aeeae","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:24:02.385113Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:39:49.218941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:25:45.948001Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.07039","last_updated":"2026-05-07T23:38:50Z","snapshot_observed_at":"2026-08-02T16:36:23.528400Z","submitted_at":"2026-05-07T23:38:50Z","title":"PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:39.349292Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.07039"},"observation_digest":"sha256:3bf5ee2292075e77542b3f5e1a73e2181cbbc531a2662909ad88142c8a861ad7","observation_id":"b3137228-5778-4160-88a4-893fd1c75603","resolution":{"observed_at":"2026-05-11T05:00:56.352524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-12T01:13:35.990078Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:664faaae4de4ae46ebdfc4fdb65fbe2c0e0c2c0902b86b95d643a7996da3781f","observation_id":"5630521f-8c37-4617-a14a-a9b49de7a90b","resolution":{"observed_at":"2026-05-12T08:21:25.286968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-06-30T23:12:57.154537Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:34b9fc6cc57272b6c9f385b49a959071379b85405191dfae933f400fe4e17ad7","observation_id":"57a77419-c52c-4371-a291-6d2b39a723ff","resolution":{"observed_at":"2026-07-01T13:25:45.958176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-12T17:14:49.310598Z","title":"Reinforcement learning for machine learning engineering agents.arXiv preprint arXiv:2509.01684, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-12T17:14:49.310598Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:209d434096a1b8b2b57d5fe1bd196eb6add01dddc48fc9417cf41b7616b5db74","observation_id":"86ff746c-ce33-464e-926e-0bee3a1a5c7f","resolution":{"observed_at":"2026-07-12T17:14:49.310598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.12913","last_updated":"2026-05-13T02:40:28Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T02:40:28Z","title":"Revisiting DAgger in the Era of LLM-Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:06.762156Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.12913"},"observation_digest":"sha256:16770eac5b9f4d269cf4ac83e29d1dfa89b14136cc9fd78594c0e323c84be91b","observation_id":"83d2cc52-cd90-48ae-a519-dba65306dc3c","resolution":{"observed_at":"2026-05-14T19:57:53.418198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Reinforcement learning for machine learning engineering agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3e180d0609054d2e024f47c4aa1bd9dc8572e64743e9a2c10c2b3f650f2162d8","observation_id":"082a7f23-a38a-4140-b7dd-43e98d831d0b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-31T01:39:49.218941Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25090","last_updated":"2026-07-27T21:30:39Z","snapshot_observed_at":"2026-08-07T19:23:56.811379Z","submitted_at":"2026-07-27T21:30:39Z","title":"Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T01:39:49.218941Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2607.25090"},"observation_digest":"sha256:d0a3eb7555075d1fde28c4572e37b330549dcae9b478461ddf37d6f0cee92cc6","observation_id":"b223f18e-0fb4-47d0-86b2-c12b00bf2c00","resolution":{"observed_at":"2026-07-31T01:39:49.218941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01684/citation-record","integrity":"/paper/2509.01684/integrity","json":"/paper/2509.01684/citation-record.json","paper":"/paper/2509.01684"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T12:24:02.221626Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.221626Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:b83a18193014274811ec10e3c42c0b73235973da8f44f0f43c0235ceb7945b56","observation_id":"4bf46cd9-754d-4002-aa2b-02ba6e56517d","resolution":{"observed_at":"2026-08-05T12:24:02.221626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.225364Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.225364Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:2e7560564533a25c4d969e2baf6e0ad85268ea3f19423812b3c3038497735e64","observation_id":"144bf1fe-35c3-4062-83d3-ac95553d6215","resolution":{"observed_at":"2026-08-05T12:24:02.225364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07738","last_updated":"2025-02-09T08:15:44Z","snapshot_observed_at":"2026-08-10T02:36:27.870594Z","submitted_at":"2024-04-11T13:36:29Z","title":"ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07738","snapshot_observed_at":"2026-08-05T12:24:02.228568Z","title":"Researchagent: Iterative research idea generation over scientific literature with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.228568Z"},"links":{"cited_paper":"/paper/2404.07738","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:3e70eb7afa1d7b3bac1762e96f596ed8b7a9db7905bc7b7a3d3027774a7807a1","observation_id":"594ff46b-6c87-4ac0-8d3a-9f4b2bdd3cc8","resolution":{"observed_at":"2026-08-05T12:24:02.228568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03302","last_updated":"2024-04-14T21:02:16Z","snapshot_observed_at":"2026-08-03T01:30:37.931398Z","submitted_at":"2023-10-05T04:06:12Z","title":"MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03302","snapshot_observed_at":"2026-08-05T12:24:02.231780Z","title":"Mlagentbench: Evaluating language agents on machine learning experimentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.231780Z"},"links":{"cited_paper":"/paper/2310.03302","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:6e61c658524d6ade7fece405cf0a0ee260ec9f8fc53a403a30a74640b7dd2a25","observation_id":"47afa8af-5f77-41d0-8d91-daac13edd68a","resolution":{"observed_at":"2026-08-05T12:24:02.231780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-05T12:24:02.235163Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.235163Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f497d159e5b96d0bb76d45b0b5ddbd0e5e2ec5146a3795a3a6bf45eea7f2359a","observation_id":"9966b5d1-224c-4fea-9a94-78f61bc54f1f","resolution":{"observed_at":"2026-08-05T12:24:02.235163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T12:24:02.238210Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.238210Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:be9fcabfcd88a9743a8401353b8198534c5367f2e2cd610497f375194262e2a1","observation_id":"9576ef01-37db-4382-b092-150327a1b092","resolution":{"observed_at":"2026-08-05T12:24:02.238210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-05T12:24:02.241388Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.241388Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8c90361e724e930fec06ce63db2a1a18f88a752db3b0b033bc850655f325aff9","observation_id":"c020786e-7f1e-4d7b-8ad6-9f2aee623858","resolution":{"observed_at":"2026-08-05T12:24:02.241388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.244194Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.244194Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:66da56da3897a3e900f2c3ac48a7539ffa0760fafd023fe5aa8e7d65d7d3395f","observation_id":"1f2ffa2e-60cf-4c26-9e4a-77610ae19182","resolution":{"observed_at":"2026-08-05T12:24:02.244194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T12:24:02.246946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.246946Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5ccb87d4be34bc5dc2972a40bf20880967e699e929c8c9b99b1988f5ff99f6c1","observation_id":"0e0cd02a-24e6-4518-85a8-972d9b855e2a","resolution":{"observed_at":"2026-08-05T12:24:02.246946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.249817Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.249817Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8dc84e1edbf6bad83c653ffbea1e0c57f6d4e0c02f5404366a5d175bbed3120a","observation_id":"901e5f44-53a8-4c0b-96f4-3e9d5675e960","resolution":{"observed_at":"2026-08-05T12:24:02.249817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.115067Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"1ff3a38b-b27b-4dc0-af4a-48562f3c9d98","year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.252457Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:91c13dc092899dad2cfedfbd046131639bcb1a31c679146e80bd722ce02eba3e","observation_id":"9383b62b-6c1f-4e93-858a-e3c44dd157c0","resolution":{"observed_at":"2026-08-05T12:24:03.118040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T12:24:02.254998Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.254998Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:228369bc9df2533664ecb321931607aafc61cc7709103476b398bbdbc4168b78","observation_id":"d2c05991-2083-4e0e-b769-9c67a13b0e83","resolution":{"observed_at":"2026-08-05T12:24:02.254998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.106626Z","title":"Efficient exploration in reinforcement learning","venue":null,"work_id":"5c8f4d79-a9df-4f7d-b546-129eda29d091","year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.257737Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:aa592f4aa11e8cc7a5fddf72146c43d73f000da7963e9aacc14330f6a843a513","observation_id":"ce8144c7-d782-4342-ba92-85ec442ee0c6","resolution":{"observed_at":"2026-08-05T12:24:03.109462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.098323Z","title":"On the sample complexity of reinforcement learning","venue":null,"work_id":"631231fb-3685-4c7a-a23d-e67fa8ca5133","year":2003},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.259983Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:bbbea2d3dc67e785bdfc2a19d648d10a887cccdad42b45e222750d414d4bf0da","observation_id":"df3c1527-bd08-4cde-9319-751b1c54317c","resolution":{"observed_at":"2026-08-05T12:24:03.101100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.089696Z","title":"Rllib: Abstractions for distributed reinforcement learning","venue":null,"work_id":"888293d4-b93c-4145-bfb8-5076f46d0276","year":2018},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.262328Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:714b8f3889d9410655d5ff50efe39912db27e53b935154c74534a7bf8b21c78d","observation_id":"23b6d3c8-25cc-4ef7-bd32-6497a846884b","resolution":{"observed_at":"2026-08-05T12:24:03.092922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00979","last_updated":"2022-09-20T17:15:51Z","snapshot_observed_at":"2026-08-06T09:10:55.331167Z","submitted_at":"2020-06-01T14:38:52Z","title":"Acme: A Research Framework for Distributed Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.00979","snapshot_observed_at":"2026-08-05T12:24:02.264694Z","title":"Acme: A research framework for distributed reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.264694Z"},"links":{"cited_paper":"/paper/2006.00979","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:aa7e1c945fd7646dfbb7b64104d8b07c559628f5d90c20bd9f06ef5c04b95b63","observation_id":"3e505bb6-a99a-4cf9-9558-1c793b2d0777","resolution":{"observed_at":"2026-08-05T12:24:02.264694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T12:24:02.267302Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.267302Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:c4a471add1d5910825b9a70b8b66150ebd681c5109d0f4a05524300f41d281b2","observation_id":"ebc7e94f-e431-4133-bf0c-d2d9da6c37a8","resolution":{"observed_at":"2026-08-05T12:24:02.267302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.270253Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.270253Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:3b7930bbd50e595d3ff9deaac6fce008eddc5f2d1f3ce4b4f2236010b3b4bbd3","observation_id":"c69dd7fe-66c9-4769-9702-7e26521eac41","resolution":{"observed_at":"2026-08-05T12:24:02.270253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.076035Z","title":"LangChain, October 2022","venue":null,"work_id":"559d2000-31d8-4acd-ab1b-8e65c9cd4e34","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.272628Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:888969162dba0ff9e5a83a62cfad00ef3a9e82f22743b9e690378a8868753cf3","observation_id":"87eb226d-023f-4db7-a7d6-41b1764864f8","resolution":{"observed_at":"2026-08-05T12:24:03.078785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.274949Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.274949Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:779f685fe8c32dce5ba6a4612bd62810db0f78be49187ca28171a31af6a3b1f4","observation_id":"f032b7bd-e628-47bf-871d-e3551d297aa3","resolution":{"observed_at":"2026-08-05T12:24:02.274949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09835","last_updated":"2024-08-21T13:36:30Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T12:03:21Z","title":"ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09835","snapshot_observed_at":"2026-08-05T12:24:02.277658Z","title":"Ml-bench: Evaluating large language models and agents for machine learning tasks on repository-level code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.277658Z"},"links":{"cited_paper":"/paper/2311.09835","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8454f0b71ada5658f1e1f96bbb59a1bb62f5886ac9daf7832e743350bd6da752","observation_id":"744c909d-1d45-4ef6-aa4d-29e09ab1a074","resolution":{"observed_at":"2026-08-05T12:24:02.277658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20424","last_updated":"2024-11-05T19:46:38Z","snapshot_observed_at":"2026-08-09T09:48:01.790453Z","submitted_at":"2024-10-27T12:44:25Z","title":"AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20424","snapshot_observed_at":"2026-08-05T12:24:02.281057Z","title":"Autokaggle: A multi-agent framework for autonomous data science competitions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.281057Z"},"links":{"cited_paper":"/paper/2410.20424","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:cea88de6695ad84b37a474d49ebc98edfa2fc6ff4acbbb26db4007be414eb4b5","observation_id":"bbc19c93-e2ff-42b8-b25e-cd50ec355bb9","resolution":{"observed_at":"2026-08-05T12:24:02.281057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.284049Z","title":"Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.284049Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:7c10e4cd6e48ca07e464690d4130419ff071424b22e3aad04a6ee943ea4bf3c0","observation_id":"61707d3e-b884-480a-81fa-d9330985d6e4","resolution":{"observed_at":"2026-08-05T12:24:02.284049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.286622Z","title":"Large language models orchestrating structured reasoning achieve kaggle grandmaster level","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.286622Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4c014ee5c134e9501202865ef4de7bbacc0e074c88c173c4c33a9102919461e0","observation_id":"526feaf1-92f5-44d8-b182-03db1f964a93","resolution":{"observed_at":"2026-08-05T12:24:02.286622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06664","last_updated":"2025-03-09T15:29:46Z","snapshot_observed_at":"2026-08-07T17:18:49.579181Z","submitted_at":"2025-03-09T15:29:46Z","title":"Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06664","snapshot_observed_at":"2026-08-05T12:24:02.289207Z","title":"Exploring llm agents for cleaning tabular machine learning datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.289207Z"},"links":{"cited_paper":"/paper/2503.06664","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:2f868c23aa6814f273e0ab1058d3f0c61a03ab7f184db6bc2ac727fbef38c754","observation_id":"b49b0a67-8f9d-4605-8bc0-3af9bf940daa","resolution":{"observed_at":"2026-08-05T12:24:02.289207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15627","last_updated":"2025-05-06T15:53:34Z","snapshot_observed_at":"2026-08-10T14:03:29.928964Z","submitted_at":"2025-01-26T18:25:26Z","title":"HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI","version":2},"cited_work":{"arxiv_id":"2501.15627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15627","snapshot_observed_at":"2026-08-05T12:24:02.722405Z","title":"HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI","venue":"cs.LG","work_id":"d7f039e2-b713-4be7-810d-9f28274f881e","year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.292197Z"},"links":{"cited_paper":"/paper/2501.15627","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:fda004e76d90095a2567488914f5fbcf379b2ba38de2e753141c84ffb5e565a3","observation_id":"4ad69974-7d04-4d41-9bf4-127080bd50a7","resolution":{"observed_at":"2026-08-05T12:24:02.725488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02499","last_updated":"2023-05-04T02:09:43Z","snapshot_observed_at":"2026-08-08T04:58:54.612776Z","submitted_at":"2023-05-04T02:09:43Z","title":"AutoML-GPT: Automatic Machine Learning with GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02499","snapshot_observed_at":"2026-08-05T12:24:02.294801Z","title":"Automl-gpt: automatic machine learning with gpt (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.294801Z"},"links":{"cited_paper":"/paper/2305.02499","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:02a1a98f2e5e4975078fce3f4cd5c5435a5ef878b532932ce3d56cdd72aac2ba","observation_id":"e5ce4061-220c-472e-a887-5c0ffc568eca","resolution":{"observed_at":"2026-08-05T12:24:02.294801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01881","last_updated":"2025-02-26T13:57:13Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:12:05Z","title":"Large Language Model Agent for Hyper-Parameter Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01881","snapshot_observed_at":"2026-08-05T12:24:02.297408Z","title":"Large language model agent for hyper-parameter optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.297408Z"},"links":{"cited_paper":"/paper/2402.01881","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8cccd84ad1cb2c3c2a93c459e2e086782602c5f193f3d8f60608f2ec3966223c","observation_id":"f59c9e87-c56e-446c-ab10-a4a91451733a","resolution":{"observed_at":"2026-08-05T12:24:02.297408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10478","last_updated":"2024-12-25T16:38:51Z","snapshot_observed_at":"2026-08-10T14:16:09.061393Z","submitted_at":"2024-11-11T21:54:26Z","title":"Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10478","snapshot_observed_at":"2026-08-05T12:24:02.299995Z","title":"Large language models for constructing and optimizing machine learning workflows: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.299995Z"},"links":{"cited_paper":"/paper/2411.10478","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:d5550746fad43395c1fb653e9e76f4847072369db301e5fc72567397ac99da79","observation_id":"33638af2-a3fa-4291-bb47-147f2d248376","resolution":{"observed_at":"2026-08-05T12:24:02.299995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-05T12:24:02.302689Z","title":"Aide: Ai-driven exploration in the space of code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.302689Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:902dee544e90243a499874437fe3a7840307862ff0d41759cf5abccf3a36dcbe","observation_id":"1bf3b52d-1d92-4dc9-99c0-deaf8c7e7ba6","resolution":{"observed_at":"2026-08-05T12:24:02.302689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.305241Z","title":"I-mcts: Enhancing agentic automl via introspective monte carlo tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.305241Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:bee413a3ecc989fcd8aae8bebbf80e44013c12eb6f462e7951b0bb750c1c9af1","observation_id":"32b4121b-5f6d-406c-a8f9-763cddf1b368","resolution":{"observed_at":"2026-08-05T12:24:02.305241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T12:24:02.307581Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.307581Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:9dd77f6837055ebcab18b74a6d199dabe41d43c56d5e17a9b66566bc481b500b","observation_id":"f69bf019-b73c-4d00-bfab-c8cbadbbab01","resolution":{"observed_at":"2026-08-05T12:24:02.307581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12334","last_updated":"2025-08-23T18:44:57Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T06:59:24Z","title":"What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12334","snapshot_observed_at":"2026-08-05T12:24:02.310282Z","title":"What did i do wrong? quantifying llms’ sensitivity and consistency to prompt engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.310282Z"},"links":{"cited_paper":"/paper/2406.12334","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:07a81ce7a1118243e0e75cb82622552dffb106dd18378716420847bc3bd49c09","observation_id":"f040e31f-271f-434e-905f-a6f0fe38d6ab","resolution":{"observed_at":"2026-08-05T12:24:02.310282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.059816Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"19506c5c-22ba-4fea-b31a-a7babfba3b00","year":1999},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.313162Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:97946cd335ac51d7736b4352652d701893126e033ce27fbb4436423ee8e1a0c4","observation_id":"47208247-8f1c-4afa-a06e-06c1ced3c7b3","resolution":{"observed_at":"2026-08-05T12:24:03.063124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.315451Z","title":"A natural policy gradient","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.315451Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:cb6175e26813ef1bf6a0a227ed4fcc454331012397638af7e0d12b05c9322052","observation_id":"b4c2fccd-badd-4374-bad3-4d06a283d41d","resolution":{"observed_at":"2026-08-05T12:24:02.315451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.317898Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.317898Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:84ed34d78a9856db302cfa9f6473494855167f26cf3a6bbf09848417a7525cde","observation_id":"2ce322a9-b301-4171-9f00-edee91f7b9eb","resolution":{"observed_at":"2026-08-05T12:24:02.317898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.320421Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.320421Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:26d7e4c01feff0fe887c50783d888f755791e47860fbda3643d577af920ed631","observation_id":"9c921657-35d1-4b7f-9254-1fb19008fabf","resolution":{"observed_at":"2026-08-05T12:24:02.320421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.322903Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.322903Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:d378453219e8c95dfeaa472145e39c91392b8db5bd514eff5f40d0e77b7f5980","observation_id":"01289653-dd89-4bdf-b7b1-b015b37a0994","resolution":{"observed_at":"2026-08-05T12:24:02.322903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.325271Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.325271Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:1407b8db4aa2292aa95bede9c4864371229188e2bbc20222ff6a8009361bcf15","observation_id":"c862a379-db9e-4500-a98d-c075fb028046","resolution":{"observed_at":"2026-08-05T12:24:02.325271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.02878","last_updated":"2018-10-31T20:11:05Z","snapshot_observed_at":"2026-08-03T09:05:59.371784Z","submitted_at":"2017-09-08T23:13:01Z","title":"TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.02878","snapshot_observed_at":"2026-08-05T12:24:02.327658Z","title":"Tensorflow agents: Efficient batched reinforcement learning in tensorflow","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.327658Z"},"links":{"cited_paper":"/paper/1709.02878","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:11fc010247190054ee58e399a5de1f9417730d7a77d5a6d5aba7364f7832354e","observation_id":"5ff97f97-2147-4292-8299-ebd823436c31","resolution":{"observed_at":"2026-08-05T12:24:02.327658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.330223Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.330223Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:48e4f689b7986e5cdce82498287f3c11337337052ef149c9c0aec85382f07baf","observation_id":"0789f35c-5da4-4f0e-98f8-939f45184155","resolution":{"observed_at":"2026-08-05T12:24:02.330223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.332833Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.332833Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:ae363baae3acbf9bdfb9cc73335d83b33126c28f6e383970e04c39565856bcb5","observation_id":"e821198e-723f-440c-a807-9c844497fc6a","resolution":{"observed_at":"2026-08-05T12:24:02.332833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.335340Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.335340Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5dae5ffe61cad9104060a531a7ef510005e6f7fc0b359d42b191fe25901d9f8f","observation_id":"fba52266-aafe-477b-87f4-e98595bc8d66","resolution":{"observed_at":"2026-08-05T12:24:02.335340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.337694Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.337694Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:ac2f67c2094bc1d15dc46545714455777fa211db84cbd666762a4c65d0480804","observation_id":"0c9982e0-0b5c-44a5-846c-e75b2aa4f9eb","resolution":{"observed_at":"2026-08-05T12:24:02.337694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.340124Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.340124Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:1dd6906aaf407c1e93e27dfec1a356d667ea03cad8797a99ffa18e848961ca11","observation_id":"791f7e20-5df9-4eac-bc45-a78e5bbeb58e","resolution":{"observed_at":"2026-08-05T12:24:02.340124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.342410Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn’t","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.342410Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:50524b55b4cd213b3668a044658bb2e43899e612d756db110c68c7b9aae4dbda","observation_id":"110fa51b-0c9e-426f-aed5-b3fd2a2f26c8","resolution":{"observed_at":"2026-08-05T12:24:02.342410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-05T12:24:02.344754Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.344754Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f11c2f5e0213a64d7d57d45379a4a9b2d469c2c55ed38c1c13b5ee4ac8fc5418","observation_id":"a9be106b-4916-4424-b1d1-011921a36fee","resolution":{"observed_at":"2026-08-05T12:24:02.344754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:24:02.347414Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.347414Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f22c27b5cd6b0cc45c78901d1aadcef26bf05775a0c1da4a68d3769d99c48ca5","observation_id":"8d4775dd-103e-4381-b55a-ae26a0d00da0","resolution":{"observed_at":"2026-08-05T12:24:02.347414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.992857Z","title":"Agentbench: Evaluating llms as agents, 2023","venue":null,"work_id":"48989a94-2b17-4c0d-948f-1c1f4afd188d","year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.349884Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:c487ca3c47a6691a1fd37cdd0468ca68ec2fe91216247c429201d0cc2620aa2d","observation_id":"054e1061-806e-475b-af2f-b24adf327aa1","resolution":{"observed_at":"2026-08-05T12:24:02.995813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10198","last_updated":"2022-04-22T01:45:49Z","snapshot_observed_at":"2026-07-06T13:02:32.003396Z","submitted_at":"2022-04-18T17:23:11Z","title":"Context-Aware Language Modeling for Goal-Oriented Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2204.10198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10198","snapshot_observed_at":"2026-08-05T12:24:02.489048Z","title":"Context-Aware Language Modeling for Goal-Oriented Dialogue Systems","venue":"cs.CL","work_id":"08394768-7a19-41d2-8c84-c90d8c80c909","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.352831Z"},"links":{"cited_paper":"/paper/2204.10198","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:7e5e712d518a5ea36ad64108781d3c1f2052edeec3156c79bbe7fb2c7775acc5","observation_id":"f725624d-fd98-4f03-9ba1-766c3fe32d60","resolution":{"observed_at":"2026-08-05T12:24:02.492803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.984217Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":"8bb25634-4562-4588-8288-08f958dc02c4","year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.355657Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:c4313552d91619cc0f7f79d61845465251dd61f2f342e9d008e0019693234d3c","observation_id":"6d631304-f8d8-4a31-bb62-83143c552e6e","resolution":{"observed_at":"2026-08-05T12:24:02.987270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08426","last_updated":"2022-04-18T17:43:21Z","snapshot_observed_at":"2026-07-06T13:01:23.308354Z","submitted_at":"2022-04-18T17:43:21Z","title":"CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08426","snapshot_observed_at":"2026-08-05T12:24:02.358017Z","title":"Chai: A chatbot ai for task-oriented dialogue with offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.358017Z"},"links":{"cited_paper":"/paper/2204.08426","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:aa243817244f7a9e87774b653af38c023bff1e9052e289b854a36a030090de90","observation_id":"c4b31ec5-ca97-4e35-a30f-4380ee3cba57","resolution":{"observed_at":"2026-08-05T12:24:02.358017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.975415Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig","venue":null,"work_id":"f3519a27-44f8-4a52-91a3-e13ed0c1b3b8","year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.360468Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:d48c0b3c1ab78af615fcdb52972f56234450653778b3a6aaed546b30a3fd83e9","observation_id":"e560e437-4891-4104-bbe9-cfd7031438cb","resolution":{"observed_at":"2026-08-05T12:24:02.978372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.08941","last_updated":"2015-09-11T23:16:13Z","snapshot_observed_at":"2026-07-06T04:22:23.546609Z","submitted_at":"2015-06-30T05:51:11Z","title":"Language Understanding for Text-based Games Using Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1506.08941","doi":null,"metadata_source":"pith","pith_arxiv_id":"1506.08941","snapshot_observed_at":"2026-08-05T12:24:02.467557Z","title":"Language Understanding for Text-based Games Using Deep Reinforcement Learning","venue":"cs.CL","work_id":"9e124b26-8aa6-488b-8150-cc59b3657d07","year":2015},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.362897Z"},"links":{"cited_paper":"/paper/1506.08941","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:30434918eee662edac80b1fbf1cc543024fbd939a6984e1c5bb5da8d0c24bdeb","observation_id":"a9c7e422-c2ae-4624-8714-edd191db63da","resolution":{"observed_at":"2026-08-05T12:24:02.472444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11871","last_updated":"2023-05-01T04:42:27Z","snapshot_observed_at":"2026-08-04T02:07:56.186059Z","submitted_at":"2022-06-05T18:38:42Z","title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11871","snapshot_observed_at":"2026-08-05T12:24:02.365511Z","title":"Offline rl for natural language generation with implicit language q learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.365511Z"},"links":{"cited_paper":"/paper/2206.11871","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:67cb877d7051c852202fef795c38502ba240d43fb105d7c0be0b0a4ad3833285","observation_id":"bd9f13a9-47f1-4a00-b732-6889e6f75555","resolution":{"observed_at":"2026-08-05T12:24:02.365511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-05T12:24:02.368310Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.368310Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:cef9b93c4716c3152de6abbcedb8e113b2c750ecbb5a4c38bd58d100c3bb3390","observation_id":"ef0ee11a-e246-440f-8cbe-5c3556f6446b","resolution":{"observed_at":"2026-08-05T12:24:02.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-05T12:24:02.371405Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.371405Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:7b706ac848e801c65c621ce283be968d713f0c7f3105e8b8300f178797a2ac3e","observation_id":"86d3afb9-4361-46b8-b3d1-ff99a13bd789","resolution":{"observed_at":"2026-08-05T12:24:02.371405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-05T12:24:02.374376Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.374376Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:ad2aa10891eedc66d155925421083a220b4944949bff5d1c6ff6585cfd17b452","observation_id":"afebba1c-3ec7-4a55-b95c-cf857a34b4f3","resolution":{"observed_at":"2026-08-05T12:24:02.374376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-03T07:29:21.763809Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-05T12:24:02.377155Z","title":"Au- tonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.377155Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:55ace5ff64b8f39b9410417e47b2999c02a6a57f419b703abaaba532551b641f","observation_id":"b270066d-cec2-4cf4-9af0-0983af8ac565","resolution":{"observed_at":"2026-08-05T12:24:02.377155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04764","last_updated":"2024-02-07T11:27:45Z","snapshot_observed_at":"2026-08-05T18:35:49.744409Z","submitted_at":"2024-02-07T11:27:45Z","title":"Code as Reward: Empowering Reinforcement Learning with VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04764","snapshot_observed_at":"2026-08-05T12:24:02.379856Z","title":"Code as reward: Empowering reinforcement learning with vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.379856Z"},"links":{"cited_paper":"/paper/2402.04764","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:26c7d4c6407213f7fbba70b08dc695c3131e6bec81d2cae145465d78645ded46","observation_id":"5ef0f259-b734-480b-83f0-32aa46ffb8de","resolution":{"observed_at":"2026-08-05T12:24:02.379856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-03T08:44:22.056144Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-05T12:24:02.382469Z","title":"Llm-as-a-judge & reward model: What they can and cannot do","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.382469Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:1eb37802acce2355dae6449b788149211b9c15e5defd02b597dceb142ad5a395","observation_id":"a27a564b-280b-4a49-950f-36f9344456a2","resolution":{"observed_at":"2026-08-05T12:24:02.382469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.966925Z","title":"‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [","venue":null,"work_id":"579f77f5-7100-4b32-9bf8-173a579762a3","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.385113Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8daca7582954c8024aea16677f72237a02ec8a3f3daadccc5372e4d8089801bf","observation_id":"d6fa3e54-ec90-476f-bda8-0103cde99a26","resolution":{"observed_at":"2026-08-05T12:24:02.969875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2509.01684."}