Pith. sign in

Paper Citation Record · LEDGER

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies

As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2508.03194.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.03194 v1

Coverage vector

measured 59 of 59 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T04:39:10.038427Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

59 of 59 outbound references displayed

  • verified exact6
  • verified fuzzy6
  • unresolved45
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f31cc6b1-dd95-41d7-a058-ac0fba07e79b · outbound

This paper cites Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.594756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.594756Z digest=sha256:cbe9a8773b830427072d6d87e708a36a1d3ff759c81bfdcd007874c0cd706b0b

Observation 92cfd7de-2a3c-40c0-a7fb-d1657f3d4f4a · outbound

This paper cites DeepSeek-V3 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepSeek-V3 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.097893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.097893Z digest=sha256:338854b2190b2b7cf50f69223fd07170e472a8a469ea35184b463ce51411cd96

Observation 296bd663-b3a3-44d7-bc7d-4bd91fe21d45 · outbound

This paper cites D4RL: Datasets for Deep Data-Driven Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.167095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.167095Z digest=sha256:54cc1e2d8b4544fb6400131437fae7395f7141309e1fe4a18a8d27bc8d91940c

Observation 35bd2519-08ce-4023-b351-bbb96f5dc2d8 · outbound

This paper cites Girshick.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Girshick

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.713021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:02.300702Z digest=sha256:5f1d397252becb759aae3e34d56eff740c0fbbb7bf3748c21e806320abcd2399

Observation 96e5cc89-4cfe-4d15-ab9a-c4abf82b6a4d · outbound

This paper cites Scaling Laws for Autoregressive Generative Modeling.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Laws for Autoregressive Generative Modeling

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.375698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.375698Z digest=sha256:bb2e2b172f6c10795f1b73abf5216322953d5cc4f89173baf184fee2d09ac779

Observation 5d04cc46-6e85-4cf5-9072-1bfbf717c71d · outbound

This paper cites Scaling Laws for Neural Language Models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Laws for Neural Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.650942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.650942Z digest=sha256:7221230bde6669353004ff1fe993d13290eef22cb63d9f8f3451baf69d8d6dd5

Observation 47ec75fa-639c-468d-930a-43b7db5d5488 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Kimi K2: Open Agentic Intelligence

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.714676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.714676Z digest=sha256:47382b74018994c3aca67fe26c63a8f5e471bf54e2b219df20cba92552262b6b

Observation 6bf65cda-86bb-4f74-8cc7-f8bb7f90a255 · outbound

This paper cites SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.901710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.901710Z digest=sha256:cb4adfac325764bc3e9410b97aa17a6fd148f8b5187aa6235c07ec56a339e2ff

Observation c276368b-ee5a-4e92-a097-6a6b93eaab6a · outbound

This paper cites Hyperspherical Normalization for Scalable Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Hyperspherical Normalization for Scalable Deep Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.965845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.965845Z digest=sha256:bb3980ccd2d48734a8b79d7440f45e1887573b4b8bd1af64fdb9f9746c351ebd

Observation 8aeb3b80-7dba-4d80-92f9-104d6f66f7a0 · outbound

This paper cites HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.697025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:03.194469Z digest=sha256:a5c1cb572c7ff428adad031b66bc476947884cf01b70ef2bf9968ac51d9f8f74

Observation 56a88053-8484-4f20-8e2e-d2afacf86fab · outbound

This paper cites Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.382391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.382391Z digest=sha256:9dcf120cd31b9d93221cae9f6234aa51046663cfcd9a48aed55ef5d955b3bf88

Observation 07612d32-42f0-4bb3-aa7b-7ae7f7c8a48a · outbound

This paper cites Encouraging divergent thinking in large language models through multi-agent debate.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Encouraging divergent thinking in large language models through multi-agent debate

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.524958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:03.493412Z digest=sha256:811c955c2aaaeddd953dad2e0ed0a666cb5a2708766bcea8344574646574a102

Observation ae716863-0aee-4800-8dcb-9cc490fe3269 · outbound

This paper cites Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.647835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.647835Z digest=sha256:2c49f75e2c731e48119c898646d90a3681a90369d7523349e87bab05c6ecda59

Observation e62efe48-f42d-494a-8f2f-e426e9358a9c · outbound

This paper cites Continuous control with deep reinforcement learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Continuous control with deep reinforcement learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.814369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.814369Z digest=sha256:17a86f1b9f013f19af6a2046e18109684e0843ecfa78bc16792c8ffa8251d753

Observation 74b92fd2-80fe-457e-8dfc-f7d363cc0b3b · outbound

This paper cites Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.024925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.024925Z digest=sha256:48b4a90f9acd16f31a2c91e36ee2c3ca590dca7688444bee6cff50965bb121b1

Observation fc48908a-06b0-4ce2-b747-1ddc66b74c69 · outbound

This paper cites Evolutionary Action Selection for Gradient-based Policy Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Evolutionary Action Selection for Gradient-based Policy Learning

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.504235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:04.163212Z digest=sha256:5f4dc48ca7a19503b08a776511740c0ebcfcdab91d10488f3ff5af34827675da

Observation 51f80b10-ba54-4325-9ee9-7544de71c491 · outbound

This paper cites Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.390690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.390690Z digest=sha256:bf23a547d26f9bea0d6af20e5bfeac5576ed82d329f4dec6eebd164ecdf548b2

Observation 92c82929-f926-4f15-9a69-7230b4fb38e3 · outbound

This paper cites SmolVLM: Redefining small and efficient multimodal models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies SmolVLM: Redefining small and efficient multimodal models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.547064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.547064Z digest=sha256:ac639f9b6dc2c6538eced26f25e8075f690b318da6e3dd0aa183d4e25bb921be

Observation b41a1983-3b77-479e-b2b4-547f72c1f91f · outbound

This paper cites The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:12.305554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:04.763706Z digest=sha256:9a0b951e0d9d498686e78c68e546104b0fcf8de5ad4999393795eef1b9cc3711

Observation da9c01ce-fac7-4106-a460-3eab38e783ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Playing Atari with Deep Reinforcement Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:04.975317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:04.975317Z digest=sha256:f214a75a9a410eec8921412644aa397059c11cfe0acbe8ecc143b101ecd7747c

Observation 4ac0e78e-37c2-4042-a3bb-e7e062983975 · outbound

This paper cites s1: Simple test-time scaling.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies s1: Simple test-time scaling

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.355060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.355060Z digest=sha256:903ec7c5838a1de0e4c89cbeca353e8bff3cdf1dac64758b2e045f3af5cc3f4c

Observation bc77ead2-1f30-42fd-9916-5280d93a49ee · outbound

This paper cites Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.516882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.516882Z digest=sha256:84d595ca8f53f1b5d26781ad0fa176730dbf8192a8edad8fd9879c6bf0d583bd

Observation d69bd5f6-b29c-4465-8e1a-1022b874b711 · outbound

This paper cites Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.661675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.661675Z digest=sha256:9f3e515a011ab10cf45a6d5e34ec682965e2cb8cac1bc003e0175b0f5cde1156

Observation 4a4c2d2b-a15e-4637-9c60-fc9a674349fd · outbound

This paper cites GPT-4 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies GPT-4 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:05.858336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:05.858336Z digest=sha256:9ed6ce4ccff4e40b7dc309d3c4c663a411bcaed16dcf7508ded0683fa487589d

Observation 47bb1096-30d7-43a5-a96a-02dbf597181b · outbound

This paper cites Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.014406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.014406Z digest=sha256:3e914b955ec54965162ca27ab8775a94660352790a89916d1d19f4b60b1928dd

Observation 91a7e734-9132-4d03-924d-422473fb67a7 · outbound

This paper cites Generative Agents: Interactive Simulacra of Human Behavior.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Generative Agents: Interactive Simulacra of Human Behavior

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.216173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.216173Z digest=sha256:89f013e1380ada19e022037363db939978e777e3cc80cf4cf0fbe5710eb12c99

Observation c74ba78b-7db9-4f46-8b3c-08b0b3c1f5da · outbound

This paper cites Horizon reduction makes rl scalable.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Horizon reduction makes rl scalable

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.374492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.374492Z digest=sha256:b0bbde3f1257ca794011d77407d4d5f7b97e545e6b3f1f8c5e0635d019967aa6

Observation 4322a865-7636-4446-89a9-6b6f44e3eac0 · outbound

This paper cites Qwen3 Technical Report.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Qwen3 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.606659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.606659Z digest=sha256:bf8cbbb62260704f9e8a688b869413160177db40620cc9c25cd1e717174ef3bc

Observation e7d746db-8c02-4bce-8d81-72aab31f19d0 · outbound

This paper cites Value-Based Deep RL Scales Predictably.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Value-Based Deep RL Scales Predictably

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.797394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.797394Z digest=sha256:85c7d0ead948fff39b66fae2c9de0696a106940438735ca3c43c416d99fc8f2c

Observation 0977ce65-9c9f-4280-b9d4-0b48ef20c4eb · outbound

This paper cites Proximal Policy Optimization Algorithms.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Proximal Policy Optimization Algorithms

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:06.960332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:06.960332Z digest=sha256:a609a8aaa3fb0940ee901b84f0ba99c714dd2ef39fcffa29cf050ba71fac3cf9

Observation 2866452a-e27c-4565-b71c-001936c8ccbe · outbound

This paper cites FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.111116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.111116Z digest=sha256:c5fda35e185f5c65a8d7ce0840d926f46b6c11caa2a870fe3f753471d1244dbf

Observation 14655a44-f98d-4c09-9a60-a5429f3718e3 · outbound

This paper cites HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.312483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.312483Z digest=sha256:b6d649fbe9b2fad199e1bd15231b909d5ae23564c308b088755d589eef94685c

Observation 8e775b0e-68c3-4b0e-923c-35b5b6e8b0b1 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.470093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.470093Z digest=sha256:aa6fbbf3ec91410a642659baeb3dae774ce360fc28fca6f03c761428cf41f664

Observation 04bfc398-424b-4cec-927b-236058396c63 · outbound

This paper cites Q-Learning for Continuous Actions with Cross-Entropy Guided Policies.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Q-Learning for Continuous Actions with Cross-Entropy Guided Policies

Reference 46

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T04:39:11.817965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:07.677891Z digest=sha256:dbd337587b45c033dbd5419d7852ca9759fc96b57ce1d5cfc7c7d2cd850aaacc

Observation 7ede08de-cc52-470f-b1a8-d678163e58ef · outbound

This paper cites Accelerated Methods for Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Accelerated Methods for Deep Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.841303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.841303Z digest=sha256:407a19354c544a50b67ebd02a3c35d1222e70c0f5e945333c78ffe0bd2882292

Observation 5a627790-67da-4c89-ad59-60d9bc95771b · outbound

This paper cites DeepMind Control Suite.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies DeepMind Control Suite

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:07.992274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:07.992274Z digest=sha256:ba7fd9e8dc3804503d71c8a79f200563cceb18a242d15bb8244b6c8d2645d0b0

Observation 7141075c-d58a-45f0-8b00-941519ddc798 · outbound

This paper cites MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:11.383388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:08.410191Z digest=sha256:97137321e3f5aa9c040412276c550c60cfe27c59cf195ef5651be683c000af7d

Observation 84e66027-628c-4006-9e36-350330d06cc5 · outbound

This paper cites 1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies 1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.569861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.569861Z digest=sha256:965565c96cf920969e87257c366b3ae9e235390075ae6193133ce142a089dcf2

Observation 337e92b0-c427-4c5a-89f0-58d39828bdf0 · outbound

This paper cites Prioritized Generative Replay.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Prioritized Generative Replay

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.778688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.778688Z digest=sha256:f8d604ebb4ef49a0a91df465a8820b872b83a4fe0942a262db7d7b978332c8b6

Observation 0b721e05-0aca-4a3c-acb4-07f2f438a046 · outbound

This paper cites Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-06T04:39:11.084778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:08.949726Z digest=sha256:5263190973614f1a08bd71164abca00f45467a98da3cd54eb32bc73dc06c2670

Observation cabf089c-1e07-48ef-ae7f-f1337a470e7f · outbound

This paper cites Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.115603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:09.151122Z digest=sha256:62dd1f487353a9b7fbcae85d284e3f4606e837bd436b355f8344e1ebbeebabb3

Observation 31bb396d-a529-48b7-9603-00011f03b0a5 · outbound

This paper cites ISBN 979-8-3503-5067-8.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies ISBN 979-8-3503-5067-8

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:09.364581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:09.364581Z digest=sha256:b62b06d8b966eb0c9418c76a8bb348cea6e873aa815b8501e4895d0a85e39a56

Observation 876de244-d1a8-43a5-949e-3d1b876a59b0 · outbound

This paper cites Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble

Reference 56

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T04:39:10.681491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:09.528457Z digest=sha256:e65fb2d4a986125562f1f582b83a10e89047df158e9acb2dbab9db459cbaac03

Observation 7d462103-b0b5-4e41-af02-4e275f73f6ba · outbound

This paper cites Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:09.721695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:09.721695Z digest=sha256:e0c71e50f0106ad19ecfd8938b270630d246b3cbd15e8b0d94cb7630b303d41e

Observation 4b44c69d-357d-472a-9f0c-5501184607d3 · outbound

This paper cites doi: 10.3233/FAIA230609.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies doi: 10.3233/FAIA230609

Reference 58

Resolution
verified exact
doi, observed 2026-08-06T04:39:10.335341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:09.891263Z digest=sha256:5c4a02b286b59d12abf31924526134d61b095247383c977565bf7b75b29c739b

Observation 862ee5f6-ec79-47a6-9c0c-48aa3c87c5a4 · outbound

This paper cites Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:10.038427Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:10.038427Z digest=sha256:eb0e4821799fedbd5dc43d37fb2157b4bd960e716d4b4cc6fb844dfb70ff073c

Observation f8ff49ef-a2ff-469f-a26a-7272292de7a0 · outbound

This paper cites URLB: Unsupervised Reinforcement Learning Benchmark.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies URLB: Unsupervised Reinforcement Learning Benchmark

Reference 1989

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.796315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.796315Z digest=sha256:aecc9de87f34cfc6f1a5850ceb98ebd529f8358331cd5ce99c1596f58177169f

Observation 7187d104-04a6-4c4b-a531-0a2095337020 · outbound

This paper cites Representation Learning with Contrastive Predictive Coding.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Representation Learning with Contrastive Predictive Coding

Reference 2012

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:08.202891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:08.202891Z digest=sha256:81e82431f00943a539b6ea75bc18735b2fef57ff62fb9d791678beef04ec8745

Observation a134f84a-fae4-43cf-b484-559d0e84c0b2 · outbound

This paper cites Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu

Reference 2015

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.306588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:05.143346Z digest=sha256:ec0663c4501db602dfba6a35d4c4135ad8425a659f68c326077db93fe5146097

Observation 6a5219e7-61fd-45cc-965a-1298248ee48f · outbound

This paper cites MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.907116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.907116Z digest=sha256:833958f116c2c78d2fd63e98faf37653e642498fb1f7ea871f7d480a600144e6

Observation 60cc0364-9d78-44e9-bb00-880a11a28b55 · outbound

This paper cites Scaling laws for single-agent reinforcement learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Scaling laws for single-agent reinforcement learning

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.461192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.461192Z digest=sha256:3e84f4d20d9515889d6578c9894e828ed0fc8efc2c5e21836971dd74d733b9ab

Observation 0a5445b3-83e8-45f8-bdab-b98429e1a043 · outbound

This paper cites Simplifying Deep Temporal Difference Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Simplifying Deep Temporal Difference Learning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.239780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.239780Z digest=sha256:2c9289df11a647d9e8aba0590f7cb2fd55dd494330ce241ae1ef6727d814ebc0

Observation f1ea7b3f-1edb-49f9-93a2-677f9a47c633 · outbound

This paper cites UCB Exploration via Q-Ensembles.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies UCB Exploration via Q-Ensembles

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.982238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.982238Z digest=sha256:d8e7f9a3b6b7f47a4b1b72340f98c024634d011555da25b9f9ee0d8fabbbc907

Observation 115464bc-a918-4615-9f44-a6b1b78e8fdc · outbound

This paper cites OpenAI Gym.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies OpenAI Gym

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.830561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.830561Z digest=sha256:b57f53f1bc8d425421c700a3be31c30a8e6d5a16e6ca678e8f1adce8a221ef97

Observation 41b4c15e-3f08-4f6d-a758-9d2b65e1d10a · outbound

This paper cites Phasic policy gradient.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Phasic policy gradient

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:13.844864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:02.050002Z digest=sha256:d99c288f03223815c7d601508a9f6dbf48a89ed65fa4163331ea592526433168

Observation b7addc73-5c8a-44e7-ac44-dd8f8b35bfbe · outbound

This paper cites Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.060592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.060592Z digest=sha256:5a13e8400249753da6afd461a67951d93ea6782f69d0d19cf855f3a8e9f801e0

Observation 4cb6c6bc-60cc-4f75-89d2-424822a76ed4 · outbound

This paper cites Dota 2 with Large Scale Deep Reinforcement Learning.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Dota 2 with Large Scale Deep Reinforcement Learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:01.745617Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:01.745617Z digest=sha256:b29832e7dad4900814b531c4dda2b922d22bad38192e07bfdd3bde4c8ed889e7

Observation decb3e77-a2a3-4f19-9afd-b62762b65cb1 · outbound

This paper cites Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:02.562616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:02.562616Z digest=sha256:f59fc4bbdcfb736ce18b59cdea3ba4321aaab3cca891bda0efb2e9f3e40f5227

Observation 469c9732-ca93-42e9-ba3f-7db283b79c39 · outbound

This paper cites Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T04:39:14.006027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T04:39:01.673860Z digest=sha256:74a4e9f8d4a520b864cab3bb6d6cfb478def6de74d741ce44575464b812145d2

Pith citing papers

No inbound Pith citation observations are available.