Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning for Machine Learning Engineering Agents

As of 15 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2509.01684.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.01684 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T12:24:02.385113Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 7 of 7 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T01:39:49.218941Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T13:25:45.948001Z

Reference resolution

62 of 62 outbound references displayed

  • verified exact3
  • verified fuzzy10
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4bf46cd9-754d-4002-aa2b-02ba6e56517d · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

Reinforcement Learning for Machine Learning Engineering Agents SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.221626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.221626Z digest=sha256:a1bd9110b342a6cf1289e543c740c74cad2517b92971055997112260b3acd89f

Observation 144bf1fe-35c3-4062-83d3-ac95553d6215 · outbound

This paper cites Swe-agent: Agent-computer interfaces enable automated software engineering.

Reinforcement Learning for Machine Learning Engineering Agents Swe-agent: Agent-computer interfaces enable automated software engineering

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.225364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.225364Z digest=sha256:825881216ad18fa74977aa3f17634abd720f4b3f3d527a27cbdff6b5c8c2c538

Observation 594ff46b-6c87-4ac0-8d3a-9f4b2bdd3cc8 · outbound

This paper cites ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models.

Reinforcement Learning for Machine Learning Engineering Agents ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.228568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.228568Z digest=sha256:99ae59c42fe691f67a6fcb82bd0e59d952fba555168c5e90705cdd819492edee

Observation 47afa8af-5f77-41d0-8d91-daac13edd68a · outbound

This paper cites MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation.

Reinforcement Learning for Machine Learning Engineering Agents MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.231780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.231780Z digest=sha256:bff970a7def663bc60963b330eedeb50a860b5ab2a47924d84001bc8210ab828

Observation 9966b5d1-224c-4fea-9a94-78f61bc54f1f · outbound

This paper cites MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering.

Reinforcement Learning for Machine Learning Engineering Agents MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.235163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.235163Z digest=sha256:7a45450c162d8ad11208558e1030080e65463d79035f41144f1aca2e2bd73648

Observation 9576ef01-37db-4382-b092-150327a1b092 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

Reinforcement Learning for Machine Learning Engineering Agents Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.238210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.238210Z digest=sha256:351ed9fc0a49fe500f253cf34a5144f5c631c60cd206bac9d37090b7736036e5

Observation c020786e-7f1e-4d7b-8ad6-9f2aee623858 · outbound

This paper cites Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models.

Reinforcement Learning for Machine Learning Engineering Agents Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.241388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.241388Z digest=sha256:569347309802fba63a4d6f4458d055dff99264bf42d047f23641d2137f0bba94

Observation 1f2ffa2e-60cf-4c26-9e4a-77610ae19182 · outbound

This paper cites Reinforcement learning: An introduction, volume 1.

Reinforcement Learning for Machine Learning Engineering Agents Reinforcement learning: An introduction, volume 1

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.244194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.244194Z digest=sha256:fbc5616e61f4eb0c12bf799c2a19935cf4daa49898cb290e6b971dbc84263938

Observation 0e0cd02a-24e6-4518-85a8-972d9b855e2a · outbound

This paper cites Qwen2.5 Technical Report.

Reinforcement Learning for Machine Learning Engineering Agents Qwen2.5 Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.246946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.246946Z digest=sha256:dae4c8c9a20a9c5744a4f1bad1f038a375210ddccf205a583dfa412a3f6197b6

Observation 901e5f44-53a8-4c0b-96f4-3e9d5675e960 · outbound

This paper cites Markov decision processes: discrete stochastic dynamic programming.

Reinforcement Learning for Machine Learning Engineering Agents Markov decision processes: discrete stochastic dynamic programming

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.249817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.249817Z digest=sha256:d94bb1bfe40f5a33054dd495beb93339d5bd2d431be682d7688782aaac71b232

Observation 9383b62b-6c1f-4e93-858a-e3c44dd157c0 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

Reinforcement Learning for Machine Learning Engineering Agents Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.118040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.252457Z digest=sha256:4e935bc656f0fc644b957dd74a5ccf7db65a6fba2c4295ad0d3b26a6682c96bd

Observation d2c05991-2083-4e0e-b769-9c67a13b0e83 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Reinforcement Learning for Machine Learning Engineering Agents Proximal Policy Optimization Algorithms

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.254998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.254998Z digest=sha256:55108e997a6f7fab9f0e3cd48b96d4f9f932c383edaa17dee5aaf19401143a41

Observation ce8144c7-d782-4342-ba92-85ec442ee0c6 · outbound

This paper cites Efficient exploration in reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Efficient exploration in reinforcement learning

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.109462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.257737Z digest=sha256:2e38b5b31bc4b44a529a0a9ece4bd38e79ed19b1e3ff5de62852e2ba15565b33

Observation df3c1527-bd08-4cde-9319-751b1c54317c · outbound

This paper cites On the sample complexity of reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents On the sample complexity of reinforcement learning

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.101100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.259983Z digest=sha256:c1a02494c62e6e6c479e7b060751b65dd24ea48fa96821d40313894db5ca471d

Observation 23b6d3c8-25cc-4ef7-bd32-6497a846884b · outbound

This paper cites Rllib: Abstractions for distributed reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Rllib: Abstractions for distributed reinforcement learning

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.092922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.262328Z digest=sha256:a04608beb39760e06e1f96d52535ff9d8de8b4f4d1aaff20e267312668a57c2e

Observation 3e505bb6-a99a-4cf9-9558-1c793b2d0777 · outbound

This paper cites Acme: A Research Framework for Distributed Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents Acme: A Research Framework for Distributed Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.264694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.264694Z digest=sha256:1718518a1bef6bb83137cd46c259cb86048e88d46fdf1ebd9201a8469b6370e5

Observation ebc7e94f-e431-4133-bf0c-d2d9da6c37a8 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

Reinforcement Learning for Machine Learning Engineering Agents HybridFlow: A Flexible and Efficient RLHF Framework

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.267302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.267302Z digest=sha256:f45db5226c75d1a01c272ac61385c0b5f1a177b6ca3caba7504829e6628eb0bf

Observation c69dd7fe-66c9-4769-9702-7e26521eac41 · outbound

This paper cites Openhands: An open platform for ai software developers as generalist agents.

Reinforcement Learning for Machine Learning Engineering Agents Openhands: An open platform for ai software developers as generalist agents

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.270253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.270253Z digest=sha256:fbd3becc8885d5e25c26de7724a4c529dae7f8df3d90d73ae373bd5a68780f41

Observation 87eb226d-023f-4db7-a7d6-41b1764864f8 · outbound

This paper cites LangChain, October 2022.

Reinforcement Learning for Machine Learning Engineering Agents LangChain, October 2022

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.078785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.272628Z digest=sha256:3ec8b86d7282b71ce523d5a77185a1aaf3e3dfae4226d1e999285630b3c0d836

Observation f032b7bd-e628-47bf-871d-e3551d297aa3 · outbound

This paper cites an unresolved cited work.

Reinforcement Learning for Machine Learning Engineering Agents Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.274949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.274949Z digest=sha256:78fdeefebd543b3ca4034164ba5b02da4067955a48fe2facf0c0a9a157ecdd93

Observation 744c909d-1d45-4ef6-aa4d-29e09ab1a074 · outbound

This paper cites ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code.

Reinforcement Learning for Machine Learning Engineering Agents ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.277658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.277658Z digest=sha256:984f92728febeb00b89bd8169245dcc7c0ea5f545ce93fcc8985375a3975e1b5

Observation bbc19c93-e2ff-42b8-b25e-cd50ec355bb9 · outbound

This paper cites AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions.

Reinforcement Learning for Machine Learning Engineering Agents AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.281057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.281057Z digest=sha256:e5a52a45641aca3ab97b7daa75cc486c758bbd6f2d884109c6adc8ba885ef135

Observation 61707d3e-b884-480a-81fa-d9330985d6e4 · outbound

This paper cites Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025.

Reinforcement Learning for Machine Learning Engineering Agents Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.284049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.284049Z digest=sha256:2328593cc2416c039ff0590df5891f4b28ba0fd27b116d5ae4f17fc00593878f

Observation 526feaf1-92f5-44d8-b182-03db1f964a93 · outbound

This paper cites Large language models orchestrating structured reasoning achieve kaggle grandmaster level.

Reinforcement Learning for Machine Learning Engineering Agents Large language models orchestrating structured reasoning achieve kaggle grandmaster level

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.286622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.286622Z digest=sha256:7f8ef6ba2903b42757e26cb8ac8ac4495ed5f61e707d35ce630638c09c5b98ae

Observation b49b0a67-8f9d-4605-8bc0-3af9bf940daa · outbound

This paper cites Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets.

Reinforcement Learning for Machine Learning Engineering Agents Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.289207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.289207Z digest=sha256:2a409cbfd15894b131ee4a73e24b3940f9cee99f9f5c2af542a1e64f4571b3d6

Observation 4ad69974-7d04-4d41-9bf4-127080bd50a7 · outbound

This paper cites HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI.

Reinforcement Learning for Machine Learning Engineering Agents HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.725488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.292197Z digest=sha256:ad073ff3427e3eed0426fd6d6e7891e63ebc93fc3e2225b3a0b4bb469ba08b43

Observation e5ce4061-220c-472e-a887-5c0ffc568eca · outbound

This paper cites AutoML-GPT: Automatic Machine Learning with GPT.

Reinforcement Learning for Machine Learning Engineering Agents AutoML-GPT: Automatic Machine Learning with GPT

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.294801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.294801Z digest=sha256:0c7ea8722ae413f72d2c562bf4358ecf585c3a9ad9eb86f00b78c1d657739fab

Observation f59c9e87-c56e-446c-ab10-a4a91451733a · outbound

This paper cites Large Language Model Agent for Hyper-Parameter Optimization.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Model Agent for Hyper-Parameter Optimization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.297408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.297408Z digest=sha256:17b3bf0aa0893d74ab0f097cd96d9a94323dcbb2397e44920ccb492ba99c213e

Observation 33638af2-a3fa-4291-bb47-147f2d248376 · outbound

This paper cites Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.299995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.299995Z digest=sha256:1317ee0d3bcda4d029a1cd333c51a0702e8fe5113add53161989492fc06a0ec1

Observation 1bf3b52d-1d92-4dc9-99c0-deaf8c7e7ba6 · outbound

This paper cites AIDE: AI-Driven Exploration in the Space of Code.

Reinforcement Learning for Machine Learning Engineering Agents AIDE: AI-Driven Exploration in the Space of Code

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.302689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.302689Z digest=sha256:2545888cd9d1285a6d3cf03d951f8ef33586e81a0532a072eb60e9070f697df6

Observation 32b4121b-5f6d-406c-a8f9-763cddf1b368 · outbound

This paper cites I-mcts: Enhancing agentic automl via introspective monte carlo tree search.

Reinforcement Learning for Machine Learning Engineering Agents I-mcts: Enhancing agentic automl via introspective monte carlo tree search

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.305241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.305241Z digest=sha256:42c696d1ff0be24f77dc8fd73f0dd9956df890b42235a526fd8411473800e830

Observation f69bf019-b73c-4d00-bfab-c8cbadbbab01 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Models Cannot Self-Correct Reasoning Yet

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.307581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.307581Z digest=sha256:285add13fb6b4b8c7c22aa3af0c125d85019d984fead6b1e7f397c0bf3111a6b

Observation f040e31f-271f-434e-905f-a6f0fe38d6ab · outbound

This paper cites What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering.

Reinforcement Learning for Machine Learning Engineering Agents What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.310282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.310282Z digest=sha256:330874f3e002ab209c203ea59538f26c22edd895ea573433467ecc9b3260d014

Observation 47208247-8f1c-4afa-a06e-06c1ced3c7b3 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

Reinforcement Learning for Machine Learning Engineering Agents Policy gradient meth- ods for reinforcement learning with function approximation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.063124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.313162Z digest=sha256:76009e49c0217c22d84cea6df5a68f2c8e8daa69b47b782dfd78f01b64944023

Observation b4c2fccd-badd-4374-bad3-4d06a283d41d · outbound

This paper cites A natural policy gradient.

Reinforcement Learning for Machine Learning Engineering Agents A natural policy gradient

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.315451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.315451Z digest=sha256:f3f7d844f9e1b8ba566ee3076ba29b98b7a4c412f4279cb8694a401ccd2d0b8e

Observation 2ce322a9-b301-4171-9f00-edee91f7b9eb · outbound

This paper cites Trust region policy optimization.

Reinforcement Learning for Machine Learning Engineering Agents Trust region policy optimization

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.317898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.317898Z digest=sha256:6159ee3862f85c625fb7cc6e1d285f0dd21f41d76981b6e55b5f932ec7d6852b

Observation 9c921657-35d1-4b7f-9254-1fb19008fabf · outbound

This paper cites Q-learning.

Reinforcement Learning for Machine Learning Engineering Agents Q-learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.320421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.320421Z digest=sha256:f01bcd30e56e78acda23aca25eccec8b707cc9d6748d69d8bae318aa498cb5b4

Observation 01289653-dd89-4bdf-b7b1-b015b37a0994 · outbound

This paper cites Mujoco: A physics engine for model-based control.

Reinforcement Learning for Machine Learning Engineering Agents Mujoco: A physics engine for model-based control

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.322903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.322903Z digest=sha256:ebe70a2c6068456083577356ca4d1acb761760da9fc0e84b08c6e032b4f36c48

Observation c862a379-db9e-4500-a98d-c075fb028046 · outbound

This paper cites The arcade learning environment: An evaluation platform for general agents.

Reinforcement Learning for Machine Learning Engineering Agents The arcade learning environment: An evaluation platform for general agents

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.325271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.325271Z digest=sha256:58f42012953be7d18c7170b67bd114f43dc5e84ec45ef36a1a20c2fd35d0b5f8

Observation 5ff97f97-2147-4292-8299-ebd823436c31 · outbound

This paper cites TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow.

Reinforcement Learning for Machine Learning Engineering Agents TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.327658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.327658Z digest=sha256:e47ce1805fd288da8cd890885139476080162e875f3be6ec5441239a667ac20e

Observation 0789f35c-5da4-4f0e-98f8-939f45184155 · outbound

This paper cites Training language models to follow instructions with human feedback.

Reinforcement Learning for Machine Learning Engineering Agents Training language models to follow instructions with human feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.330223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.330223Z digest=sha256:9dc809176dc28ed119eb1a65c30a16ceccbf61242211d81574cecc5ebefbf2a8

Observation e821198e-723f-440c-a807-9c844497fc6a · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Reinforcement Learning for Machine Learning Engineering Agents Direct preference optimization: Your language model is secretly a reward model

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.332833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.332833Z digest=sha256:8144e0b2c753268153207ddb16fc0d46173455c369fe92646287c492234c7acb

Observation fba52266-aafe-477b-87f4-e98595bc8d66 · outbound

This paper cites Brown, Miljan Martic, Shane Legg, and Dario Amodei.

Reinforcement Learning for Machine Learning Engineering Agents Brown, Miljan Martic, Shane Legg, and Dario Amodei

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.335340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.335340Z digest=sha256:ce0b82193d26fe3e1fc89b43c897e3f85554bb23e6e31a5f97b546ca6563d288

Observation 0c9982e0-0b5c-44a5-846c-e75b2aa4f9eb · outbound

This paper cites Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B.

Reinforcement Learning for Machine Learning Engineering Agents Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.337694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.337694Z digest=sha256:8a3eb07d3d60c23f8997ae237093895e63b7a9879c28dee96d351fd614c98bd4

Observation 791f7e20-5df9-4eac-bc45-a78e5bbeb58e · outbound

This paper cites Rlaif: Scaling reinforcement learning from human feedback with ai feedback.

Reinforcement Learning for Machine Learning Engineering Agents Rlaif: Scaling reinforcement learning from human feedback with ai feedback

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.340124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.340124Z digest=sha256:5775bcabfc5e0fe5f4eb55bd67e549a4cd5c459551b7b42036b3085bc5e68557

Observation 110fa51b-0c9e-426f-aed5-b3fd2a2f26c8 · outbound

This paper cites Reinforcement learning for reasoning in small llms: What works and what doesn’t.

Reinforcement Learning for Machine Learning Engineering Agents Reinforcement learning for reasoning in small llms: What works and what doesn’t

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.342410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.342410Z digest=sha256:93e1d06a0f3b626685d790d94bbeb23e7ead49c24e5473c49fc6b0c29cbde466

Observation a9be106b-4916-4424-b1d1-011921a36fee · outbound

This paper cites SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution.

Reinforcement Learning for Machine Learning Engineering Agents SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.344754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.344754Z digest=sha256:02e7bc101d2970fd413113034ee98eaecf47cf4ed4136e83d856070007523990

Observation 8d4775dd-103e-4381-b55a-ae26a0d00da0 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.347414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.347414Z digest=sha256:17e259c555847264aad434511b2b5f0bef1dc16e5f9c12efaae852ab6641e692

Observation 054e1061-806e-475b-af2f-b24adf327aa1 · outbound

This paper cites Agentbench: Evaluating llms as agents, 2023.

Reinforcement Learning for Machine Learning Engineering Agents Agentbench: Evaluating llms as agents, 2023

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.995813Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.349884Z digest=sha256:75b37e39b82b42bdd00565d40dd7ca1c8cddd44e7b7a2abd555b5db7659c5413

Observation f725624d-fd98-4f03-9ba1-766c3fe32d60 · outbound

This paper cites Context-Aware Language Modeling for Goal-Oriented Dialogue Systems.

Reinforcement Learning for Machine Learning Engineering Agents Context-Aware Language Modeling for Goal-Oriented Dialogue Systems

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.492803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.352831Z digest=sha256:b85054a2516f83e0bc0716ed78f4bab4d9992168b078908da3029de09d6d3f1c

Observation 6d631304-f8d8-4a31-bb62-83143c552e6e · outbound

This paper cites Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.987270Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.355657Z digest=sha256:a9581f7be2b984779daec3e91e38086ebccff5ae2edfd6048ab42a3927315bb9

Observation c4b31ec5-ca97-4e35-a30f-4380ee3cba57 · outbound

This paper cites CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.358017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.358017Z digest=sha256:94873a99c9cbee7dd51d95ea451604d1a6c9de6c441ee9ed389b2c943ca1f842

Observation e560e437-4891-4104-bbe9-cfd7031438cb · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig.

Reinforcement Learning for Machine Learning Engineering Agents Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.978372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.360468Z digest=sha256:abcfc593edfe84f029e22eaafe2b84defa4671b2d28e797b9f44791870b03ea3

Observation a9c7e422-c2ae-4624-8714-edd191db63da · outbound

This paper cites Language Understanding for Text-based Games Using Deep Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents Language Understanding for Text-based Games Using Deep Reinforcement Learning

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.472444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.362897Z digest=sha256:9090412c5575882355384211a115455a24fddcbfc4a997dd4824090bfc8fb58e

Observation bd9f13a9-47f1-4a00-b732-6889e6f75555 · outbound

This paper cites Offline RL for Natural Language Generation with Implicit Language Q Learning.

Reinforcement Learning for Machine Learning Engineering Agents Offline RL for Natural Language Generation with Implicit Language Q Learning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.365511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.365511Z digest=sha256:e643aadcda37800eb3464b24c47ab4e74cd460d829d9997eb94781bef263ec73

Observation ef0ee11a-e246-440f-8cbe-5c3556f6446b · outbound

This paper cites Process Reward Models for LLM Agents: Practical Framework and Directions.

Reinforcement Learning for Machine Learning Engineering Agents Process Reward Models for LLM Agents: Practical Framework and Directions

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.368310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.368310Z digest=sha256:8d00047ab08563425c40d76a7c779c27d2ff852078a24b2f27581229658c7e77

Observation 86d3afb9-4361-46b8-b3d1-ff99a13bd789 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

Reinforcement Learning for Machine Learning Engineering Agents Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.371405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.371405Z digest=sha256:cfdbb16bcccda2421f98b0dccc6a5c92fdb7bf7fdbebc38949b575816719fa88

Observation afebba1c-3ec7-4a55-b95c-cf857a34b4f3 · outbound

This paper cites Generative Reward Models.

Reinforcement Learning for Machine Learning Engineering Agents Generative Reward Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.374376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.374376Z digest=sha256:581fc48ba676149c737ac205d012050a2e9528770a58cddc6a932a6b72487ddf

Observation b270066d-cec2-4cf4-9af0-0983af8ac565 · outbound

This paper cites Autonomous Evaluation and Refinement of Digital Agents.

Reinforcement Learning for Machine Learning Engineering Agents Autonomous Evaluation and Refinement of Digital Agents

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.377155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.377155Z digest=sha256:e3b8cb979cef1a2885a2adfaf60e64d3376b8f0651d919fb48a41e36450169d7

Observation 5ef0f259-b734-480b-83f0-32aa46ffb8de · outbound

This paper cites Code as Reward: Empowering Reinforcement Learning with VLMs.

Reinforcement Learning for Machine Learning Engineering Agents Code as Reward: Empowering Reinforcement Learning with VLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.379856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.379856Z digest=sha256:0f1657ca090cb34321aeb8e6ee6a43e8e4d5f036c437f76df870a2f6fcf9e581

Observation a27a564b-280b-4a49-950f-36f9344456a2 · outbound

This paper cites LLM-as-a-Judge & Reward Model: What They Can and Cannot Do.

Reinforcement Learning for Machine Learning Engineering Agents LLM-as-a-Judge & Reward Model: What They Can and Cannot Do

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.382469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.382469Z digest=sha256:44304f0283cc43d185d837047dc3b3b96e0d964206ac6987ab858246042eb13e

Observation d6fa3e54-ec90-476f-bda8-0103cde99a26 · outbound

This paper cites ‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [.

Reinforcement Learning for Machine Learning Engineering Agents ‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.969875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T12:24:02.385113Z digest=sha256:de64b496980cf7923d06f01007742c937043536dd177888312cb818c26321d09

Pith citing papers

Observation b3137228-5778-4160-88a4-893fd1c75603 · inbound

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents cites this paper.

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents Reinforcement Learning for Machine Learning Engineering Agents

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:00:56.352524Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-11T00:54:39.349292Z digest=sha256:d94ec9f93b224ed70638187290e5e814d82a49b421854694b54d81a0d4e174b6

Observation 5630521f-8c37-4617-a14a-a9b49de7a90b · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 114

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:21:25.286968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T01:13:35.990078Z digest=sha256:3125242ee85541586a54011a80fab5805bb6cb58e34baf3010abf7298cdf8a85

Observation 57a77419-c52c-4371-a291-6d2b39a723ff · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 116

Resolution
verified exact
arxiv_id, observed 2026-07-01T13:25:45.958176Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-30T23:12:57.154537Z digest=sha256:ea253508f33f20e9cab536fb84079d0a1a6ca1f8a5a6718799245dced1945894

Observation 86ff746c-ce33-464e-926e-0bee3a1a5c7f · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 115

Resolution
unresolved
no resolver link, observed 2026-07-12T17:14:49.310598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T17:14:49.310598Z digest=sha256:66e4e91ef3ddc2faa26986e4a65841a65fdcbc52f5de17a2265a4668daa4d389

Observation 83d2cc52-cd90-48ae-a519-dba65306dc3c · inbound

Revisiting DAgger in the Era of LLM-Agents cites this paper.

Revisiting DAgger in the Era of LLM-Agents Reinforcement Learning for Machine Learning Engineering Agents

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:57:53.418198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-14T19:56:06.762156Z digest=sha256:b0573b77360af8cb69a76327ead2cf62f89a0d2390a947e2267bad92b661cfe8

Observation 082a7f23-a38a-4140-b7dd-43e98d831d0b · inbound

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards cites this paper.

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards Reinforcement Learning for Machine Learning Engineering Agents

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-14T11:28:23.511747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:28:23.511747Z digest=sha256:52287f8694bef44cbc1582cb7b351c76010246d69b1acda9da40b8589037c40e

Observation b223f18e-0fb4-47d0-86b2-c12b00bf2c00 · inbound

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering cites this paper.

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering Reinforcement Learning for Machine Learning Engineering Agents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-31T01:39:49.218941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T01:39:49.218941Z digest=sha256:1467e3ec26caea4a5b0837751d0f0b59d07dc43a01525852d281dea13b329ced