{"as_of":"2026-08-15T09:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23bc76be3cc3c1a42c08b09b4f8a14b18b80f4683a4b51468419edd17ee75ffb","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:10.038427Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03194/citation-record","integrity":"/paper/2508.03194/integrity","json":"/paper/2508.03194/citation-record.json","paper":"/paper/2508.03194"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.01465","last_updated":"2019-12-02T16:00:20Z","snapshot_observed_at":"2026-08-15T00:33:55.512920Z","submitted_at":"2019-10-03T13:40:46Z","title":"Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01465","snapshot_observed_at":"2026-08-06T04:39:01.594756Z","title":"Reducing overestimation bias in multi-agent domains using double centralized critics","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.594756Z"},"links":{"cited_paper":"/paper/1910.01465","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:cbe9a8773b830427072d6d87e708a36a1d3ff759c81bfdcd007874c0cd706b0b","observation_id":"f31cc6b1-dd95-41d7-a058-ac0fba07e79b","resolution":{"observed_at":"2026-08-06T04:39:01.594756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T04:39:02.097893Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.097893Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:23adad45414a01b33f8ac00069ebaff2eda7fd9ffa0de7659a23f5475397f312","observation_id":"92cfd7de-2a3c-40c0-a7fb-d1657f3d4f4a","resolution":{"observed_at":"2026-08-06T04:39:02.097893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-14T04:09:47.636898Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T04:39:02.167095Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.167095Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9ec8e373c8ebdd7dab634bf2cde9144786062cd4c94baf7175b4bb627f8e7e3c","observation_id":"296bd663-b3a3-44d7-bc7d-4bd91fe21d45","resolution":{"observed_at":"2026-08-06T04:39:02.167095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.646411Z","title":"Girshick","venue":null,"work_id":"108ea4c2-d509-4f18-96f2-46ecc0d6096b","year":2020},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.300702Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:557615c9c67da509bc394a77f6394e8e622a818e3aa1cc2b1858ba07913b2b3e","observation_id":"35bd2519-08ce-4023-b351-bbb96f5dc2d8","resolution":{"observed_at":"2026-08-06T04:39:13.713021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T04:39:02.375698Z","title":"Scaling laws for autoregressive generative modeling.arXiv preprint arXiv:2010.14701,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.375698Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:bb2e2b172f6c10795f1b73abf5216322953d5cc4f89173baf184fee2d09ac779","observation_id":"96e5cc89-4cfe-4d15-ab9a-c4abf82b6a4d","resolution":{"observed_at":"2026-08-06T04:39:02.375698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T04:39:02.650942Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.650942Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:7221230bde6669353004ff1fe993d13290eef22cb63d9f8f3451baf69d8d6dd5","observation_id":"5d04cc46-6e85-4cf5-9072-1bfbf717c71d","resolution":{"observed_at":"2026-08-06T04:39:02.650942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-06T04:39:02.714676Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.714676Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:2356ff67c6dce37862f2e75384f18edbe111c6f8a1cd912ea3c99c6b116e18f7","observation_id":"47ec75fa-639c-468d-930a-43b7db5d5488","resolution":{"observed_at":"2026-08-06T04:39:02.714676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09754","last_updated":"2025-05-29T15:02:38Z","snapshot_observed_at":"2026-08-15T06:03:28.456740Z","submitted_at":"2024-10-13T07:20:53Z","title":"SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09754","snapshot_observed_at":"2026-08-06T04:39:02.901710Z","title":"Simba: Simplicity bias for scaling up parameters in deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.901710Z"},"links":{"cited_paper":"/paper/2410.09754","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:02f19ab94e5de1bae5e547626dadafed6b6e5b064ba9aa5d3a26c15a1c249cc0","observation_id":"6bf65cda-86bb-4f74-8cc7-f8bb7f90a255","resolution":{"observed_at":"2026-08-06T04:39:02.901710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15280","last_updated":"2025-05-29T14:58:32Z","snapshot_observed_at":"2026-08-12T22:33:21.478260Z","submitted_at":"2025-02-21T08:17:24Z","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15280","snapshot_observed_at":"2026-08-06T04:39:02.965845Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.965845Z"},"links":{"cited_paper":"/paper/2502.15280","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c7730bfeada4ac4e17dbd4583cbee22d5618ed68d42c4e33c9ffa259344a230d","observation_id":"c276368b-ee5a-4e92-a097-6a6b93eaab6a","resolution":{"observed_at":"2026-08-06T04:39:02.965845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06329","last_updated":"2023-06-10T01:49:01Z","snapshot_observed_at":"2026-08-14T23:17:01.638446Z","submitted_at":"2023-06-10T01:49:01Z","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","version":1},"cited_work":{"arxiv_id":"2306.06329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.06329","snapshot_observed_at":"2026-08-06T04:39:12.650683Z","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","venue":"cs.LG","work_id":"90dfd7bd-085d-4ba7-9563-2d9127269cde","year":2023},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.194469Z"},"links":{"cited_paper":"/paper/2306.06329","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:4a3070c694d414985764fffe0754db899a3e6dae2ea39025291638cb4bb276ea","observation_id":"8aeb3b80-7dba-4d80-92f9-104d6f66f7a0","resolution":{"observed_at":"2026-08-06T04:39:12.697025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-14T02:21:20.549140Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-06T04:39:03.382391Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.382391Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9486b7a1a01116b9a000b19c9604a8f0ed451b7b2351bad9b9b4d5b64cdaaa81","observation_id":"56a88053-8484-4f20-8e2e-d2afacf86fab","resolution":{"observed_at":"2026-08-06T04:39:03.382391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.378899Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":"3d8d3ddb-da19-4193-b266-c7b34b100ca2","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.493412Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:e79fe1aca904736e0f2fd8e3903fa6b4324160a0ae7ec1effeaae165d2ff179f","observation_id":"07612d32-42f0-4bb3-aa7b-7ae7f7c8a48a","resolution":{"observed_at":"2026-08-06T04:39:13.524958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20379","last_updated":"2025-02-27T18:53:30Z","snapshot_observed_at":"2026-08-15T02:01:22.852526Z","submitted_at":"2025-02-27T18:53:30Z","title":"Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20379","snapshot_observed_at":"2026-08-06T04:39:03.647835Z","title":"doi: 10.18653/v1/2024.emnlp-main.992","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.647835Z"},"links":{"cited_paper":"/paper/2502.20379","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:150b6254ced0ff29d75c58dac73e8081f125d8bb66242f69b626c57e229af5f7","observation_id":"ae716863-0aee-4800-8dcb-9cc490fe3269","resolution":{"observed_at":"2026-08-06T04:39:03.647835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T04:39:03.814369Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.814369Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:88fccdb844e7a29ccdadf0c7566cf453429bcc6c20a14a69ad764f29ada39970","observation_id":"e62efe48-f42d-494a-8f2f-e426e9358a9c","resolution":{"observed_at":"2026-08-06T04:39:03.814369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-15T03:36:42.048644Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-06T04:39:04.024925Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.024925Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:48b4a90f9acd16f31a2c91e36ee2c3ca590dca7688444bee6cff50965bb121b1","observation_id":"74b92fd2-80fe-457e-8dfc-f7d363cc0b3b","resolution":{"observed_at":"2026-08-06T04:39:04.024925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04286","last_updated":"2022-09-16T12:32:55Z","snapshot_observed_at":"2026-08-13T17:00:26.692896Z","submitted_at":"2022-01-12T03:31:21Z","title":"Evolutionary Action Selection for Gradient-based Policy Learning","version":4},"cited_work":{"arxiv_id":"2201.04286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.04286","snapshot_observed_at":"2026-08-06T04:39:12.413521Z","title":"Evolutionary Action Selection for Gradient-based Policy Learning","venue":"cs.NE","work_id":"8fa032c1-da76-48ca-8a20-6373a2b94351","year":2022},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.163212Z"},"links":{"cited_paper":"/paper/2201.04286","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9f65dc9459dd31fc3a22996cbdbb93ad16167307bd7a5e5b2b6376192da890cb","observation_id":"fc48908a-06b0-4ce2-b747-1ddc66b74c69","resolution":{"observed_at":"2026-08-06T04:39:12.504235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T04:39:04.390690Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.390690Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:bf23a547d26f9bea0d6af20e5bfeac5576ed82d329f4dec6eebd164ecdf548b2","observation_id":"51f80b10-ba54-4325-9ee9-7544de71c491","resolution":{"observed_at":"2026-08-06T04:39:04.390690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-06T04:39:04.547064Z","title":"Smolvlm: Redefining small and efficient multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.547064Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:ac639f9b6dc2c6538eced26f25e8075f690b318da6e3dd0aa183d4e25bb921be","observation_id":"92c82929-f926-4f15-9a69-7230b4fb38e3","resolution":{"observed_at":"2026-08-06T04:39:04.547064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-09T01:29:50.351658Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"cited_work":{"arxiv_id":"2506.03404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03404","snapshot_observed_at":"2026-08-06T04:39:12.260604Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","venue":"cs.LG","work_id":"1dd0baea-8f36-494c-a9ec-b7a99a6a6425","year":2025},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.763706Z"},"links":{"cited_paper":"/paper/2506.03404","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:a01f2986a2ff1f3fc8a070b049e5c5287dbbe61c954ece8dc598bbb316eafc24","observation_id":"b41a1983-3b77-479e-b2b4-547f72c1f91f","resolution":{"observed_at":"2026-08-06T04:39:12.305554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T04:39:04.975317Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.975317Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c1f09893453e3f73973b580830e132f4ca299289c9ec975754a5973dd4d20fbc","observation_id":"da9c01ce-fac7-4106-a460-3eab38e783ba","resolution":{"observed_at":"2026-08-06T04:39:04.975317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-14T11:38:51.383664Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T04:39:05.355060Z","title":"Candès, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.355060Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:bd43422925d3d15e9de0c7fe2d9f3e59f8af43553d4fab2b4b0c00dfe3731674","observation_id":"4ac0e78e-37c2-4042-a3bb-e7e062983975","resolution":{"observed_at":"2026-08-06T04:39:05.355060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-15T00:38:34.320958Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-06T04:39:05.516882Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.516882Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:17024bc63df9acf3f73ba96d8163e5b8ac1418303dbc6eeee541b016839ac37d","observation_id":"bc77ead2-1f30-42fd-9916-5280d93a49ee","resolution":{"observed_at":"2026-08-06T04:39:05.516882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11092","last_updated":"2023-01-30T11:30:19Z","snapshot_observed_at":"2026-08-13T13:38:42.982414Z","submitted_at":"2022-11-20T21:48:25Z","title":"Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11092","snapshot_observed_at":"2026-08-06T04:39:05.661675Z","title":"Q-ensemble for offline rl: Don’t scale the ensemble, scale the batch size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.661675Z"},"links":{"cited_paper":"/paper/2211.11092","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b2fc43f0ed62ae25b3d5fb950c0739466db9126deda1b3c929bcdbd83755bc2c","observation_id":"d69bd5f6-b29c-4465-8e1a-1022b874b711","resolution":{"observed_at":"2026-08-06T04:39:05.661675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T04:39:05.858336Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.858336Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:a46cb9a452a54491143ab7109d27f5f95930ef7153d688c447c3d32c6b04a3f9","observation_id":"4a4c2d2b-a15e-4637-9c60-fc9a674349fd","resolution":{"observed_at":"2026-08-06T04:39:05.858336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-14T17:44:04.662613Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07523","snapshot_observed_at":"2026-08-06T04:39:06.014406Z","title":"Scaling off-policy reinforcement learning with batch and weight normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.014406Z"},"links":{"cited_paper":"/paper/2502.07523","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d8a6158f7afd269c9834f6c3ec4562390bf3cb5a30ba5970698591db615ed054","observation_id":"47bb1096-30d7-43a5-a96a-02dbf597181b","resolution":{"observed_at":"2026-08-06T04:39:06.014406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-08-14T04:44:13.552688Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-06T04:39:06.216173Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.216173Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:fbf0c6e4d9fbeab41b685b78a4485a38d8bd1fc8a5d9e765475223f3878ab6ad","observation_id":"91a7e734-9132-4d03-924d-422473fb67a7","resolution":{"observed_at":"2026-08-06T04:39:06.216173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:06.374492Z","title":"Horizon reduction makes rl scalable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.374492Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b0bbde3f1257ca794011d77407d4d5f7b97e545e6b3f1f8c5e0635d019967aa6","observation_id":"c74ba78b-7db9-4f46-8b3c-08b0b3c1f5da","resolution":{"observed_at":"2026-08-06T04:39:06.374492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T04:39:06.606659Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.606659Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:bf8cbbb62260704f9e8a688b869413160177db40620cc9c25cd1e717174ef3bc","observation_id":"4322a865-7636-4446-89a9-6b6f44e3eac0","resolution":{"observed_at":"2026-08-06T04:39:06.606659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-14T05:58:00.174963Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-06T04:39:06.797394Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.797394Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d7694795855b81a8fbe3a39fe0b4333bd7f0b0dab97e23a1c7d7a652c85855f7","observation_id":"e7d746db-8c02-4bce-8d81-72aab31f19d0","resolution":{"observed_at":"2026-08-06T04:39:06.797394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T04:39:06.960332Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.960332Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:8fd56de33028cc5073e8feb44310c14b1903fe9514bc52a6f06eb284d0871ca0","observation_id":"0977ce65-9c9f-4280-b9d4-0b48ef20c4eb","resolution":{"observed_at":"2026-08-06T04:39:06.960332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-13T10:18:22.884883Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-06T04:39:07.111116Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.111116Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:130a3c5865cc4d7106f748fdee89ffeeb344c570cfe88ed8328f0ee22fb28686","observation_id":"2866452a-e27c-4565-b71c-001936c8ccbe","resolution":{"observed_at":"2026-08-06T04:39:07.111116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-13T00:53:11.671999Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-06T04:39:07.312483Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.312483Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:cd14ba1d5f06b75056a202d85040a5c9210e0b0d5b69f97b0032b0f892a68d8d","observation_id":"14655a44-f98d-4c09-9a60-a5429f3718e3","resolution":{"observed_at":"2026-08-06T04:39:07.312483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T04:39:07.470093Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.470093Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:aa6fbbf3ec91410a642659baeb3dae774ce360fc28fca6f03c761428cf41f664","observation_id":"8e775b0e-68c3-4b0e-923c-35b5b6e8b0b1","resolution":{"observed_at":"2026-08-06T04:39:07.470093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10605","last_updated":"2019-07-01T21:03:09Z","snapshot_observed_at":"2026-08-14T16:56:57.508089Z","submitted_at":"2019-03-25T21:46:58Z","title":"Q-Learning for Continuous Actions with Cross-Entropy Guided Policies","version":3},"cited_work":{"arxiv_id":"1903.10605","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.10605","snapshot_observed_at":"2026-08-06T04:39:11.650771Z","title":"Q-Learning for Continuous Actions with Cross-Entropy Guided Policies","venue":"cs.AI","work_id":"8325e832-1263-4ae0-8adc-3289c83da9d9","year":2019},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.677891Z"},"links":{"cited_paper":"/paper/1903.10605","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:153d2e8a4a8c557b909452c2782c8cf42c908bbae3e03eac4a4a1c7a42dfb6d7","observation_id":"04bfc398-424b-4cec-927b-236058396c63","resolution":{"observed_at":"2026-08-06T04:39:11.817965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02811","last_updated":"2019-01-10T20:48:11Z","snapshot_observed_at":"2026-08-14T19:38:28.064874Z","submitted_at":"2018-03-07T18:39:12Z","title":"Accelerated Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02811","snapshot_observed_at":"2026-08-06T04:39:07.841303Z","title":"Accelerated methods for deep reinforcement learning.arXiv preprint arXiv:1803.02811,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.841303Z"},"links":{"cited_paper":"/paper/1803.02811","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:36d98524698e497d6357f30b265ccaf4a3d4a55cd8e103921fbe57e2558a99c0","observation_id":"7ede08de-cc52-470f-b1a8-d678163e58ef","resolution":{"observed_at":"2026-08-06T04:39:07.841303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T04:39:07.992274Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.992274Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:cb8423e03eb377fcf752c72529c19e589510d5ade6d47229d984937c19cea462","observation_id":"5a627790-67da-4c89-ad59-60d9bc95771b","resolution":{"observed_at":"2026-08-06T04:39:07.992274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08896","last_updated":"2025-04-02T18:17:24Z","snapshot_observed_at":"2026-08-12T22:25:21.140680Z","submitted_at":"2024-10-11T15:13:17Z","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","version":2},"cited_work":{"arxiv_id":"2410.08896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08896","snapshot_observed_at":"2026-08-06T04:39:11.292081Z","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","venue":"cs.LG","work_id":"919b31fe-603b-4e7a-9d39-339c96d5f6e9","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.410191Z"},"links":{"cited_paper":"/paper/2410.08896","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:90ef2cb7c12a1a3db4b1c2902d821345067a3996102db4594ca3a4deecce6cf5","observation_id":"7141075c-d58a-45f0-8b00-941519ddc798","resolution":{"observed_at":"2026-08-06T04:39:11.383388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:08.569861Z","title":"1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.569861Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:965565c96cf920969e87257c366b3ae9e235390075ae6193133ce142a089dcf2","observation_id":"84e66027-628c-4006-9e36-350330d06cc5","resolution":{"observed_at":"2026-08-06T04:39:08.569861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-08-14T19:53:20.733533Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-06T04:39:08.778688Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.778688Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:33f1e7928a60631fc041b15008549f023471a2dfecbef3fd969f54c6a9c9438c","observation_id":"337e92b0-c427-4c5a-89f0-58d39828bdf0","resolution":{"observed_at":"2026-08-06T04:39:08.778688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09159","last_updated":"2022-11-17T02:24:57Z","snapshot_observed_at":"2026-08-13T17:32:31.729051Z","submitted_at":"2021-11-17T14:48:52Z","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","version":3},"cited_work":{"arxiv_id":"2111.09159","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.09159","snapshot_observed_at":"2026-08-06T04:39:10.927974Z","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","venue":"cs.LG","work_id":"48bbba1d-43cc-4347-8227-58924c6e61c7","year":2021},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.949726Z"},"links":{"cited_paper":"/paper/2111.09159","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:1a5d9cb8238ec58a279514f5cc22a72b69444be7e490ca3af50f7abafe2c49a0","observation_id":"0b721e05-0aca-4a3c-acb4-07f2f438a046","resolution":{"observed_at":"2026-08-06T04:39:11.084778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.029321Z","title":"Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning","venue":null,"work_id":"1851fc4d-e9c7-494c-9626-f04e62b97aeb","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.151122Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9e4e10fcf8e5becab8f69a891025f5fa7cf6c56ec38cd68a8f17e650cadcf912","observation_id":"cabf089c-1e07-48ef-ae7f-f1337a470e7f","resolution":{"observed_at":"2026-08-06T04:39:13.115603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:09.364581Z","title":"ISBN 979-8-3503-5067-8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.364581Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b62b06d8b966eb0c9418c76a8bb348cea6e873aa815b8501e4895d0a85e39a56","observation_id":"31bb396d-a529-48b7-9603-00011f03b0a5","resolution":{"observed_at":"2026-08-06T04:39:09.364581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09284","last_updated":"2022-05-19T02:25:32Z","snapshot_observed_at":"2026-08-13T15:41:04.062518Z","submitted_at":"2022-05-19T02:25:32Z","title":"Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble","version":1},"cited_work":{"arxiv_id":"2205.09284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.09284","snapshot_observed_at":"2026-08-06T04:39:10.578335Z","title":"Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble","venue":"cs.LG","work_id":"39ff0c97-f171-4aa9-a60b-8680006919f0","year":2022},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.528457Z"},"links":{"cited_paper":"/paper/2205.09284","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:6d41549b4ddeba34f7a9e975dd1b18be5e4f8670c21c243a9f5321e42c2ee0aa","observation_id":"876de244-d1a8-43a5-949e-3d1b876a59b0","resolution":{"observed_at":"2026-08-06T04:39:10.681491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-06T04:39:09.721695Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.721695Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:476a9928e05b4b7a3e6e65cad0836ee244829458d2ad6347627083612923f892","observation_id":"7d462103-b0b5-4e41-af02-4e275f73f6ba","resolution":{"observed_at":"2026-08-06T04:39:09.721695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/faia230609","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"doi: 10.3233/FAIA230609","venue":"Frontiers in artificial intelligence and applications","work_id":"83ef6fd9-65cb-47b3-9f67-c3101f6156a6","year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.891263Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:61c1f195e7bcece0194fb2bf4eec8676391bc74ff2266b8d69a95230fd32ad54","observation_id":"4b44c69d-357d-472a-9f0c-5501184607d3","resolution":{"observed_at":"2026-08-06T04:39:10.335341Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07696","last_updated":"2022-09-16T03:41:50Z","snapshot_observed_at":"2026-08-13T14:25:22.901728Z","submitted_at":"2022-09-16T03:41:50Z","title":"Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07696","snapshot_observed_at":"2026-08-06T04:39:10.038427Z","title":"Towards A unified policy abstraction theory and representation learning approach in markov decision processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:10.038427Z"},"links":{"cited_paper":"/paper/2209.07696","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:253e2feb7212b8a2e14fa539719eef4a1a0dfbab8f7df354602aaf0f35ff6c77","observation_id":"862ee5f6-ec79-47a6-9c0c-48aa3c87c5a4","resolution":{"observed_at":"2026-08-06T04:39:10.038427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-13T17:44:04.784747Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T04:39:02.796315Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.796315Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:41f5a979822bee0289b8fc8d23771c79eff8496748493c0be15cee249b20e099","observation_id":"f8ff49ef-a2ff-469f-a26a-7272292de7a0","resolution":{"observed_at":"2026-08-06T04:39:02.796315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T04:39:08.202891Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.202891Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:81e82431f00943a539b6ea75bc18735b2fef57ff62fb9d791678beef04ec8745","observation_id":"7187d104-04a6-4c4b-a531-0a2095337020","resolution":{"observed_at":"2026-08-06T04:39:08.202891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.208617Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":"c3dc8bb3-06c8-4876-8002-953959efdef2","year":1928},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.143346Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:6aca0979dc5dec28bac76e51d38cd236be1d5d4a71ebc0cb3d41d49ddde8ade7","observation_id":"a134f84a-fae4-43cf-b484-559d0e84c0b2","resolution":{"observed_at":"2026-08-06T04:39:13.306588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13600","last_updated":"2022-05-26T20:11:23Z","snapshot_observed_at":"2026-08-13T15:35:45.688247Z","submitted_at":"2022-05-26T20:11:23Z","title":"MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13600","snapshot_observed_at":"2026-08-06T04:39:01.907116Z","title":"Myosuite–a contact-rich simulation suite for musculoskeletal motor control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.907116Z"},"links":{"cited_paper":"/paper/2205.13600","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:2af00143da06f022eabd078009425f6a059e6a622cee6336b5e23d80dd8f544e","observation_id":"6a5219e7-61fd-45cc-965a-1298248ee48f","resolution":{"observed_at":"2026-08-06T04:39:01.907116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13442","last_updated":"2023-02-19T01:24:51Z","snapshot_observed_at":"2026-08-13T12:54:36.786407Z","submitted_at":"2023-01-31T06:38:53Z","title":"Scaling laws for single-agent reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13442","snapshot_observed_at":"2026-08-06T04:39:02.461192Z","title":"Scaling laws for single-agent reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.461192Z"},"links":{"cited_paper":"/paper/2301.13442","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:cb55411a5cba8666238cffd2df1ed9226a30964841b04343d7b568f1ea78ac89","observation_id":"60cc0364-9d78-44e9-bb00-880a11a28b55","resolution":{"observed_at":"2026-08-06T04:39:02.461192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-12T23:27:55.293597Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T04:39:02.239780Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.239780Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9f97ca8057ee77201c8c684da93b9ce6e5f500ef2385a64f54d4395301ecd351","observation_id":"0a5445b3-83e8-45f8-bdab-b98429e1a043","resolution":{"observed_at":"2026-08-06T04:39:02.239780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01502","last_updated":"2017-11-07T20:45:59Z","snapshot_observed_at":"2026-08-14T20:55:58.284097Z","submitted_at":"2017-06-05T19:01:26Z","title":"UCB Exploration via Q-Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01502","snapshot_observed_at":"2026-08-06T04:39:01.982238Z","title":"Ucb exploration via q-ensembles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.982238Z"},"links":{"cited_paper":"/paper/1706.01502","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d8e7f9a3b6b7f47a4b1b72340f98c024634d011555da25b9f9ee0d8fabbbc907","observation_id":"f1ea7b3f-1edb-49f9-93a2-677f9a47c633","resolution":{"observed_at":"2026-08-06T04:39:01.982238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T04:39:01.830561Z","title":"Openai gym","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.830561Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b57f53f1bc8d425421c700a3be31c30a8e6d5a16e6ca678e8f1adce8a221ef97","observation_id":"115464bc-a918-4615-9f44-a6b1b78e8fdc","resolution":{"observed_at":"2026-08-06T04:39:01.830561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.770535Z","title":"Phasic policy gradient","venue":null,"work_id":"5b8b5235-81cc-41d4-9537-5c64849f1ffa","year":2020},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.050002Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9890336c11695dd0c3b6594668cc1144ed455b072ad0d31b3eded19b7ad54735","observation_id":"41b4c15e-3f08-4f6d-a758-9d2b65e1d10a","resolution":{"observed_at":"2026-08-06T04:39:13.844864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02957","last_updated":"2025-01-17T11:59:23Z","snapshot_observed_at":"2026-08-14T14:34:21.713942Z","submitted_at":"2024-05-05T14:53:51Z","title":"Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02957","snapshot_observed_at":"2026-08-06T04:39:03.060592Z","title":"Keep various trajectories: promoting exploration of ensemble policies in continuous control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.060592Z"},"links":{"cited_paper":"/paper/2405.02957","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:5ba4708d3c3cdef628d9d2d5b16531668e3fff9884ebe32fde66453ee507f9d7","observation_id":"b7addc73-5c8a-44e7-ac44-dd8f8b35bfbe","resolution":{"observed_at":"2026-08-06T04:39:03.060592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-06T04:39:01.745617Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.745617Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b29832e7dad4900814b531c4dda2b922d22bad38192e07bfdd3bde4c8ed889e7","observation_id":"4cb6c6bc-60cc-4f75-89d2-424822a76ed4","resolution":{"observed_at":"2026-08-06T04:39:01.745617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04133","last_updated":"2017-08-10T19:20:15Z","snapshot_observed_at":"2026-08-15T03:09:17.358218Z","submitted_at":"2017-08-10T19:20:15Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04133","snapshot_observed_at":"2026-08-06T04:39:02.562616Z","title":"Reproducibility of benchmarked deep reinforcement learning tasks for continuous control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.562616Z"},"links":{"cited_paper":"/paper/1708.04133","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:f59fc4bbdcfb736ce18b59cdea3ba4321aaab3cca891bda0efb2e9f3e40f5227","observation_id":"decb3e77-a2a3-4f19-9afd-b62762b65cb1","resolution":{"observed_at":"2026-08-06T04:39:02.562616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.938721Z","title":"Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song","venue":null,"work_id":"667a357e-2f2a-4f43-9ed3-84a3740d6479","year":2025},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.673860Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:408cde1a07ab58d2d3c7723956502f816e31cd108465675fc7f7475710248c73","observation_id":"469c9732-ca93-42e9-ba3f-7db283b79c39","resolution":{"observed_at":"2026-08-06T04:39:14.006027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":45,"verified_exact":6,"verified_fuzzy":6},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2508.03194."}