Pith. sign in

Paper Citation Record · LEDGER

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies

As of 14 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2508.03194.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.03194 v1

Coverage vector

measured 59 of 59 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T04:39:10.038427Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

59 of 59 outbound references displayed

  • verified exact6
  • verified fuzzy6
  • unresolved45
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f31cc6b1-dd95-41d7-a058-ac0fba07e79b · outbound

This paper cites Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.594756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.594756Z digest=sha256:47be5efa72d655a91bd063506c0b43b9243fc845aa873fb12dce39dbabcb1afa

Observation 92cfd7de-2a3c-40c0-a7fb-d1657f3d4f4a · outbound

This paper cites DeepSeek-V3 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepSeek-V3 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.097893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.097893Z digest=sha256:23adad45414a01b33f8ac00069ebaff2eda7fd9ffa0de7659a23f5475397f312

Observation 296bd663-b3a3-44d7-bc7d-4bd91fe21d45 · outbound

This paper cites D4RL: Datasets for Deep Data-Driven Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.167095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.167095Z digest=sha256:9ec8e373c8ebdd7dab634bf2cde9144786062cd4c94baf7175b4bb627f8e7e3c

Observation 35bd2519-08ce-4023-b351-bbb96f5dc2d8 · outbound

This paper cites Girshick.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Girshick

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.713021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:02.300702Z digest=sha256:ca6f7c15d31a47a64c266b983dc01201d9010ee8ab3b00f023aff8dfecf547c4

Observation 96e5cc89-4cfe-4d15-ab9a-c4abf82b6a4d · outbound

This paper cites Scaling Laws for Autoregressive Generative Modeling.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Laws for Autoregressive Generative Modeling

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.375698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.375698Z digest=sha256:bb2e2b172f6c10795f1b73abf5216322953d5cc4f89173baf184fee2d09ac779

Observation 5d04cc46-6e85-4cf5-9072-1bfbf717c71d · outbound

This paper cites Scaling Laws for Neural Language Models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Laws for Neural Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.650942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.650942Z digest=sha256:7221230bde6669353004ff1fe993d13290eef22cb63d9f8f3451baf69d8d6dd5

Observation 47ec75fa-639c-468d-930a-43b7db5d5488 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Kimi K2: Open Agentic Intelligence

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.714676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.714676Z digest=sha256:2356ff67c6dce37862f2e75384f18edbe111c6f8a1cd912ea3c99c6b116e18f7

Observation 6bf65cda-86bb-4f74-8cc7-f8bb7f90a255 · outbound

This paper cites SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.901710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.901710Z digest=sha256:71fe27805af38ccc135cb7f4a147945f4dc560b50b3fb54e3b3a47df4523facf

Observation c276368b-ee5a-4e92-a097-6a6b93eaab6a · outbound

This paper cites Hyperspherical Normalization for Scalable Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Hyperspherical Normalization for Scalable Deep Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.965845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.965845Z digest=sha256:c7730bfeada4ac4e17dbd4583cbee22d5618ed68d42c4e33c9ffa259344a230d

Observation 8aeb3b80-7dba-4d80-92f9-104d6f66f7a0 · outbound

This paper cites HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.697025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:03.194469Z digest=sha256:18d710ebd1c75767f80c06590e66bee529c799f255efb04b29a34eb717106024

Observation 56a88053-8484-4f20-8e2e-d2afacf86fab · outbound

This paper cites Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.382391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.382391Z digest=sha256:9486b7a1a01116b9a000b19c9604a8f0ed451b7b2351bad9b9b4d5b64cdaaa81

Observation 07612d32-42f0-4bb3-aa7b-7ae7f7c8a48a · outbound

This paper cites Encouraging divergent thinking in large language models through multi-agent debate.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Encouraging divergent thinking in large language models through multi-agent debate

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.524958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:03.493412Z digest=sha256:d9cc4d5f5303ab86e5e2cdac286b5a30249c7b3bfb55b0992fb77cffb8340309

Observation ae716863-0aee-4800-8dcb-9cc490fe3269 · outbound

This paper cites Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.647835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.647835Z digest=sha256:8d81c96b74656250d6b41004e1fc3e63675fba51fce34625d875160ce7b44733

Observation e62efe48-f42d-494a-8f2f-e426e9358a9c · outbound

This paper cites Continuous control with deep reinforcement learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Continuous control with deep reinforcement learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.814369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.814369Z digest=sha256:88fccdb844e7a29ccdadf0c7566cf453429bcc6c20a14a69ad764f29ada39970

Observation 74b92fd2-80fe-457e-8dfc-f7d363cc0b3b · outbound

This paper cites Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.024925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.024925Z digest=sha256:a792818f7a02dbc3007f661977da20c0f42ddfae492e0d7a939f57d63729259f

Observation fc48908a-06b0-4ce2-b747-1ddc66b74c69 · outbound

This paper cites Evolutionary Action Selection for Gradient-based Policy Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Evolutionary Action Selection for Gradient-based Policy Learning

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.504235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:04.163212Z digest=sha256:cbd6bc5260c88f62a4e46e9baf5c877d139563cb9e482c45748be4f87c3436fd

Observation 51f80b10-ba54-4325-9ee9-7544de71c491 · outbound

This paper cites Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.390690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.390690Z digest=sha256:bf23a547d26f9bea0d6af20e5bfeac5576ed82d329f4dec6eebd164ecdf548b2

Observation 92c82929-f926-4f15-9a69-7230b4fb38e3 · outbound

This paper cites SmolVLM: Redefining small and efficient multimodal models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies SmolVLM: Redefining small and efficient multimodal models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.547064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.547064Z digest=sha256:ac639f9b6dc2c6538eced26f25e8075f690b318da6e3dd0aa183d4e25bb921be

Observation b41a1983-3b77-479e-b2b4-547f72c1f91f · outbound

This paper cites The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.305554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:04.763706Z digest=sha256:e6547e3156a179fc8fb3c3629a9254549b41efbcd8db83d8029135f1ea225bde

Observation da9c01ce-fac7-4106-a460-3eab38e783ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Playing Atari with Deep Reinforcement Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.975317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.975317Z digest=sha256:c1f09893453e3f73973b580830e132f4ca299289c9ec975754a5973dd4d20fbc

Observation 4ac0e78e-37c2-4042-a3bb-e7e062983975 · outbound

This paper cites s1: Simple test-time scaling.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies s1: Simple test-time scaling

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.355060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.355060Z digest=sha256:bd43422925d3d15e9de0c7fe2d9f3e59f8af43553d4fab2b4b0c00dfe3731674

Observation bc77ead2-1f30-42fd-9916-5280d93a49ee · outbound

This paper cites Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.516882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.516882Z digest=sha256:7ef6a279d0ac5237dc405ccbb1dda9fe50ff0b5523911e4e0a505b7a0f8493f9

Observation d69bd5f6-b29c-4465-8e1a-1022b874b711 · outbound

This paper cites Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.661675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.661675Z digest=sha256:b2fc43f0ed62ae25b3d5fb950c0739466db9126deda1b3c929bcdbd83755bc2c

Observation 4a4c2d2b-a15e-4637-9c60-fc9a674349fd · outbound

This paper cites GPT-4 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies GPT-4 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.858336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.858336Z digest=sha256:a46cb9a452a54491143ab7109d27f5f95930ef7153d688c447c3d32c6b04a3f9

Observation 47bb1096-30d7-43a5-a96a-02dbf597181b · outbound

This paper cites Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.014406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.014406Z digest=sha256:d8a6158f7afd269c9834f6c3ec4562390bf3cb5a30ba5970698591db615ed054

Observation 91a7e734-9132-4d03-924d-422473fb67a7 · outbound

This paper cites Generative Agents: Interactive Simulacra of Human Behavior.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Generative Agents: Interactive Simulacra of Human Behavior

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.216173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.216173Z digest=sha256:fbf0c6e4d9fbeab41b685b78a4485a38d8bd1fc8a5d9e765475223f3878ab6ad

Observation c74ba78b-7db9-4f46-8b3c-08b0b3c1f5da · outbound

This paper cites Horizon reduction makes rl scalable.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Horizon reduction makes rl scalable

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.374492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.374492Z digest=sha256:b0bbde3f1257ca794011d77407d4d5f7b97e545e6b3f1f8c5e0635d019967aa6

Observation 4322a865-7636-4446-89a9-6b6f44e3eac0 · outbound

This paper cites Qwen3 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Qwen3 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.606659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.606659Z digest=sha256:bf8cbbb62260704f9e8a688b869413160177db40620cc9c25cd1e717174ef3bc

Observation e7d746db-8c02-4bce-8d81-72aab31f19d0 · outbound

This paper cites Value-Based Deep RL Scales Predictably.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Value-Based Deep RL Scales Predictably

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.797394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.797394Z digest=sha256:d7694795855b81a8fbe3a39fe0b4333bd7f0b0dab97e23a1c7d7a652c85855f7

Observation 0977ce65-9c9f-4280-b9d4-0b48ef20c4eb · outbound

This paper cites Proximal Policy Optimization Algorithms.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Proximal Policy Optimization Algorithms

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.960332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.960332Z digest=sha256:8fd56de33028cc5073e8feb44310c14b1903fe9514bc52a6f06eb284d0871ca0

Observation 2866452a-e27c-4565-b71c-001936c8ccbe · outbound

This paper cites FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.111116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.111116Z digest=sha256:130a3c5865cc4d7106f748fdee89ffeeb344c570cfe88ed8328f0ee22fb28686

Observation 14655a44-f98d-4c09-9a60-a5429f3718e3 · outbound

This paper cites HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.312483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.312483Z digest=sha256:cd14ba1d5f06b75056a202d85040a5c9210e0b0d5b69f97b0032b0f892a68d8d

Observation 8e775b0e-68c3-4b0e-923c-35b5b6e8b0b1 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.470093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.470093Z digest=sha256:aa6fbbf3ec91410a642659baeb3dae774ce360fc28fca6f03c761428cf41f664

Observation 04bfc398-424b-4cec-927b-236058396c63 · outbound

This paper cites Q-Learning for Continuous Actions with Cross-Entropy Guided Policies.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Q-Learning for Continuous Actions with Cross-Entropy Guided Policies

Reference 46

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T04:39:11.817965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:07.677891Z digest=sha256:4b304f08e4bd451ba743a2a53fe070d4a5f7762ee04642c9c27ce9c85cafa767

Observation 7ede08de-cc52-470f-b1a8-d678163e58ef · outbound

This paper cites Accelerated Methods for Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Accelerated Methods for Deep Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.841303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.841303Z digest=sha256:36d98524698e497d6357f30b265ccaf4a3d4a55cd8e103921fbe57e2558a99c0

Observation 5a627790-67da-4c89-ad59-60d9bc95771b · outbound

This paper cites DeepMind Control Suite.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepMind Control Suite

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.992274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.992274Z digest=sha256:cb8423e03eb377fcf752c72529c19e589510d5ade6d47229d984937c19cea462

Observation 7141075c-d58a-45f0-8b00-941519ddc798 · outbound

This paper cites MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:11.383388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:08.410191Z digest=sha256:4adcaa7fb57f9238a11759a9548395b6a85c8773c3a20a02325b18cb81677a3c

Observation 84e66027-628c-4006-9e36-350330d06cc5 · outbound

This paper cites 1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies 1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.569861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.569861Z digest=sha256:965565c96cf920969e87257c366b3ae9e235390075ae6193133ce142a089dcf2

Observation 337e92b0-c427-4c5a-89f0-58d39828bdf0 · outbound

This paper cites Prioritized Generative Replay.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Prioritized Generative Replay

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.778688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.778688Z digest=sha256:33f1e7928a60631fc041b15008549f023471a2dfecbef3fd969f54c6a9c9438c

Observation 0b721e05-0aca-4a3c-acb4-07f2f438a046 · outbound

This paper cites Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:11.084778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:08.949726Z digest=sha256:5efeae69ed64ca0b2364ead69e88faebd08c93f1df8adf86e91b73f524d33aa8

Observation cabf089c-1e07-48ef-ae7f-f1337a470e7f · outbound

This paper cites Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.115603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:09.151122Z digest=sha256:60574773e1d9bf8ba8f0cf32d030000119a74820106b4944b5196ba487b26ade

Observation 31bb396d-a529-48b7-9603-00011f03b0a5 · outbound

This paper cites ISBN 979-8-3503-5067-8.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies ISBN 979-8-3503-5067-8

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:09.364581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:09.364581Z digest=sha256:b62b06d8b966eb0c9418c76a8bb348cea6e873aa815b8501e4895d0a85e39a56

Observation 876de244-d1a8-43a5-949e-3d1b876a59b0 · outbound

This paper cites Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble

Reference 56

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T04:39:10.681491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:09.528457Z digest=sha256:d7ca42f4681723d56109ca5ddde0a43bfdcb63d911619268743269771c806afa

Observation 7d462103-b0b5-4e41-af02-4e275f73f6ba · outbound

This paper cites Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:09.721695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:09.721695Z digest=sha256:476a9928e05b4b7a3e6e65cad0836ee244829458d2ad6347627083612923f892

Observation 4b44c69d-357d-472a-9f0c-5501184607d3 · outbound

This paper cites doi: 10.3233/FAIA230609.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies doi: 10.3233/FAIA230609

Reference 58

Resolution
verified exact
doi, observed 2026-08-06T04:39:10.335341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:09.891263Z digest=sha256:dab76d6ae44b12fa8b30549fd57c35240e8f39f6cee42f99d4d1729f6866899f

Observation 862ee5f6-ec79-47a6-9c0c-48aa3c87c5a4 · outbound

This paper cites Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:10.038427Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:10.038427Z digest=sha256:253e2feb7212b8a2e14fa539719eef4a1a0dfbab8f7df354602aaf0f35ff6c77

Observation f8ff49ef-a2ff-469f-a26a-7272292de7a0 · outbound

This paper cites URLB: Unsupervised Reinforcement Learning Benchmark.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies URLB: Unsupervised Reinforcement Learning Benchmark

Reference 1989

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.796315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.796315Z digest=sha256:41f5a979822bee0289b8fc8d23771c79eff8496748493c0be15cee249b20e099

Observation 7187d104-04a6-4c4b-a531-0a2095337020 · outbound

This paper cites Representation Learning with Contrastive Predictive Coding.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Representation Learning with Contrastive Predictive Coding

Reference 2012

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.202891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.202891Z digest=sha256:81e82431f00943a539b6ea75bc18735b2fef57ff62fb9d791678beef04ec8745

Observation a134f84a-fae4-43cf-b484-559d0e84c0b2 · outbound

This paper cites Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu

Reference 2015

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.306588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:05.143346Z digest=sha256:6a76bc4e7a59e94c913e1983b5d66dafb44d6f8115e18ec2254ba0d51a08c18e

Observation 6a5219e7-61fd-45cc-965a-1298248ee48f · outbound

This paper cites MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.907116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.907116Z digest=sha256:2af00143da06f022eabd078009425f6a059e6a622cee6336b5e23d80dd8f544e

Observation 60cc0364-9d78-44e9-bb00-880a11a28b55 · outbound

This paper cites Scaling laws for single-agent reinforcement learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling laws for single-agent reinforcement learning

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.461192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.461192Z digest=sha256:cb55411a5cba8666238cffd2df1ed9226a30964841b04343d7b568f1ea78ac89

Observation 0a5445b3-83e8-45f8-bdab-b98429e1a043 · outbound

This paper cites Simplifying Deep Temporal Difference Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Simplifying Deep Temporal Difference Learning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.239780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.239780Z digest=sha256:9f97ca8057ee77201c8c684da93b9ce6e5f500ef2385a64f54d4395301ecd351

Observation f1ea7b3f-1edb-49f9-93a2-677f9a47c633 · outbound

This paper cites UCB Exploration via Q-Ensembles.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies UCB Exploration via Q-Ensembles

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.982238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.982238Z digest=sha256:d8e7f9a3b6b7f47a4b1b72340f98c024634d011555da25b9f9ee0d8fabbbc907

Observation 115464bc-a918-4615-9f44-a6b1b78e8fdc · outbound

This paper cites OpenAI Gym.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies OpenAI Gym

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.830561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.830561Z digest=sha256:b57f53f1bc8d425421c700a3be31c30a8e6d5a16e6ca678e8f1adce8a221ef97

Observation 41b4c15e-3f08-4f6d-a758-9d2b65e1d10a · outbound

This paper cites Phasic policy gradient.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Phasic policy gradient

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.844864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:02.050002Z digest=sha256:ef05ef91ace273a84138df0b471fd562cfbe6ff3955917314ab4ec4aaeece85b

Observation b7addc73-5c8a-44e7-ac44-dd8f8b35bfbe · outbound

This paper cites Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.060592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.060592Z digest=sha256:5ba4708d3c3cdef628d9d2d5b16531668e3fff9884ebe32fde66453ee507f9d7

Observation 4cb6c6bc-60cc-4f75-89d2-424822a76ed4 · outbound

This paper cites Dota 2 with Large Scale Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Dota 2 with Large Scale Deep Reinforcement Learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.745617Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.745617Z digest=sha256:b29832e7dad4900814b531c4dda2b922d22bad38192e07bfdd3bde4c8ed889e7

Observation decb3e77-a2a3-4f19-9afd-b62762b65cb1 · outbound

This paper cites Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.562616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.562616Z digest=sha256:de5d7f9ee13c73d6aee3c19c2e6b5444a94b8fdadb9b85da0c48075beb6e9061

Observation 469c9732-ca93-42e9-ba3f-7db283b79c39 · outbound

This paper cites Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:14.006027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T04:39:01.673860Z digest=sha256:a9f90134781f4efe39e84999dea04726bdd57c46b6c91cf54b214ca70f301d63

Pith citing papers

No inbound Pith citation observations are available.