{"as_of":"2026-08-09T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b64606a7652f5257fbab8637dcf3f1ca093151e641db88fcf68c3d5704657514","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:50:34.155640Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:52.599976Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T23:09:12.714863Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-07T12:58:52.599976Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:52.599976Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4fbb26a76069ca823bf06f9a876764b51aeca4d9dd018a59d288da5c70987e40","observation_id":"c54498a5-69f8-4676-9eeb-e9dc48e64daa","resolution":{"observed_at":"2026-08-07T12:58:52.599976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-06T04:39:06.797394Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.797394Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:453a93fb5a41636124690f818261a5eb16642ceea68a46755e5d5a012063abe4","observation_id":"e7d746db-8c02-4bce-8d81-72aab31f19d0","resolution":{"observed_at":"2026-08-06T04:39:06.797394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":"2502.04327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":"fc4149d3-64aa-4c0d-95c9-a0a34b00df8e","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T05:33:19.038889Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:756dad42a119ecc60c02980dfff73daf37f1339c6441855b33bb287ab070f813","observation_id":"b6387637-3a7d-4c8d-ab63-6aa13395de49","resolution":{"observed_at":"2026-05-12T05:36:24.580539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":"2502.04327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":"fc4149d3-64aa-4c0d-95c9-a0a34b00df8e","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:38.643667Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:c9d3a5d88cff2203963e29d1d5d99493eb549c0c84dbaa4460ee27c268dab8c5","observation_id":"cadfc5c9-2956-4f39-ade1-1c0075c43668","resolution":{"observed_at":"2026-05-13T06:32:24.810267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":"2502.04327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":"fc4149d3-64aa-4c0d-95c9-a0a34b00df8e","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T23:04:12.943222Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:315bc68f4eb6173364dd1d96594a9ed0cadb71d71d192220559a717847a90c20","observation_id":"19d61ca9-241b-4520-8130-36a7f28b563c","resolution":{"observed_at":"2026-05-20T23:09:12.718570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04327/citation-record","integrity":"/paper/2502.04327/integrity","json":"/paper/2502.04327/citation-record.json","paper":"/paper/2502.04327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:33.979227Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.979227Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:997a0b82e427e47d385ec511fb26d05476e4ef4f4d56fa6d092755a1e63e415d","observation_id":"a94a2006-4cda-4f14-981a-d5d2dda951c6","resolution":{"observed_at":"2026-08-08T22:50:33.979227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.670686Z","title":"GPT -4 technical report","venue":null,"work_id":"60c976d1-c7e1-4678-a0f0-5bb62374a845","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.983471Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:3feb91eaf9816d69404063ea113c15bcfe1e8d4013391b1bfd96360ba3d9dc77","observation_id":"ab0650aa-07fb-499b-9796-cde2ef210b24","resolution":{"observed_at":"2026-08-08T22:50:34.673980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.661399Z","title":"The isotonic regression problem and its dual","venue":null,"work_id":"ad0d06e2-7206-41ce-9c30-78c1e73c7d95","year":1972},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.986597Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:5c47fc83a3e0450643f2ede9e3414c9a3993d88dc5525311c041781e0ab83590","observation_id":"46769471-4517-4647-ad00-03ab6025acd0","resolution":{"observed_at":"2026-08-08T22:50:34.664945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.652394Z","title":"Pattern Recognition and Machine Learning","venue":null,"work_id":"5d4bcd36-1489-44a5-902f-0e79bcaa479f","year":2006},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.990214Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:50121e563ac98d72e75ca43362f2534bb2343f82f98423461ce3132a49efe571","observation_id":"d089a7e0-efd8-4d33-834b-0c01e5af1a3a","resolution":{"observed_at":"2026-08-08T22:50:34.655527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.643650Z","title":"OpenAI Gym , 2016","venue":null,"work_id":"df92ba47-e370-4dbf-8e75-1df403d6f402","year":2016},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.993346Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:0533b42b385b11e1828d10ffbe1d928681b3e644029a5ab0273e24a035ea2576","observation_id":"2a04ab3d-9f6b-422c-a0dc-1c5360bd21ee","resolution":{"observed_at":"2026-08-08T22:50:34.646732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:33.996307Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.996307Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:d043f169b0a96548b90c9cd39a8aad380a3530e1bdc2965bbc6742eaf843d88f","observation_id":"7eb90764-31b0-40c4-b454-096967c9bbc5","resolution":{"observed_at":"2026-08-08T22:50:33.996307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.628851Z","title":"Randomized ensembled double Q -learning: Learning fast without a model","venue":null,"work_id":"71de9ebc-7b24-490c-8dc0-ac40ff1e3c0f","year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:33.999739Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:7e0f4b56bdfb13cd1663218209988879cfb8754b6e2355f1c2f389e47c7673b6","observation_id":"852f239f-9b6c-4765-8c63-6b52b164378d","resolution":{"observed_at":"2026-08-08T22:50:34.632177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.619998Z","title":"The value-improvement path: Towards better representations for reinforcement learning","venue":null,"work_id":"3af49f17-9255-417a-ab37-44f9b5d2aaf5","year":2021},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.002855Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:f83c5c31ed0a5f61c6991f94864c753db44a70f9f045bfa873c89b4d6c9817ec","observation_id":"60159157-8014-4dbf-88d1-249abf341791","resolution":{"observed_at":"2026-08-08T22:50:34.623340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.610948Z","title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","venue":null,"work_id":"70761289-23f3-49d3-b99f-ad641bd3fafd","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.005965Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:c291b6bbff76367b705141f8f11d0b8a8d69bfea9b5f8b5bb1de883729258c90","observation_id":"3f4817d9-e105-4c53-9a66-0ca15e87e663","resolution":{"observed_at":"2026-08-08T22:50:34.614096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.602225Z","title":"The Llama 3 herd of models","venue":null,"work_id":"46c07f3b-99e3-4d95-8070-bf1deda9acda","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.009020Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:de85ee9447f0e8e6bcd2b7080331165ac8ce84eaaf8bcac0b39c3792df9e8c03","observation_id":"b2c7db4c-7743-4e74-9ef8-232c268208c6","resolution":{"observed_at":"2026-08-08T22:50:34.605256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.593282Z","title":"IMPALA : Scalable distributed deep- RL with importance weighted actor-learner architectures","venue":null,"work_id":"4a16b8ed-297d-47f2-b3bf-672ef3ef9e49","year":2018},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.011583Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:3742a94107e1f70e41d7f1a7a326174bdd9c7160b9afc92237ee6a9e9989f900","observation_id":"8cc2861c-5e2b-4a33-b119-9338a2ee829a","resolution":{"observed_at":"2026-08-08T22:50:34.596658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.584508Z","title":"Language models scale reliably with over-training and on downstream tasks","venue":null,"work_id":"03920cbf-f146-4c00-aebb-09346fb7cae6","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.014741Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:c722070ff5317f80d8ef3a3bf103e9f2221c230d8f8bc7f0163ec33957d766f5","observation_id":"d5250699-4756-407d-8bbb-dc4baada40de","resolution":{"observed_at":"2026-08-08T22:50:34.587849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.575616Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":"bcc804e9-d258-44a9-920a-77f2bfeb7a2f","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.017377Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:d9fa3b45e4e33c0c7f341a09f14130e9dab102f6932bda51b472dc7ef3b3dc36","observation_id":"8ccf7e35-19a6-4457-8bca-a0d23914458b","resolution":{"observed_at":"2026-08-08T22:50:34.578847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.020093Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.020093Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:29670abda6de977a8ec23e181e3874576c512bf0b1650d2045a6da782d94b70c","observation_id":"65dda2fc-cb8a-4df9-831e-6e5e1a2a50b8","resolution":{"observed_at":"2026-08-08T22:50:34.020093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.561631Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"42a1997c-ff62-4f1a-a6db-31bb291a8c7b","year":2018},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.022820Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:5f92f7ac361799d4660b0fb009b927aa8dd651b3db772f4a14459f771553abe7","observation_id":"6868a284-8f1c-40c2-b8f4-abef9ae465be","resolution":{"observed_at":"2026-08-08T22:50:34.564758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.553522Z","title":"Mastering diverse domains through world models","venue":null,"work_id":"9400260f-5426-49c2-8710-9fc4557e1f12","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.025588Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:fff1f0748d943788e444e293e2e1dd0754e2ff85bb7bb0b7460a7e7c396636aa","observation_id":"a9aabe5d-25c1-4a34-a9d0-7b6e22123557","resolution":{"observed_at":"2026-08-08T22:50:34.556484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.544734Z","title":"Scaling laws for single-agent reinforcement learning","venue":null,"work_id":"243d3957-957a-4341-8d7d-b8c646731e6b","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.028174Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:3e2dc2d16c8127b372910bbf1483fc49bb84468fd79c0b7a0887d190d0a1e147","observation_id":"f93fd152-ee35-4bb2-8b61-7b5df227e8e4","resolution":{"observed_at":"2026-08-08T22:50:34.547912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.536064Z","title":"Training compute-optimal large language models","venue":null,"work_id":"127aaede-69c5-440e-b2b5-323376bfd99f","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.031060Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:90ff4ba98fe87e1a5dd8f8873724df47d8272fe04b67c89e8c9e35df1e53871a","observation_id":"38c12941-3766-4884-abc6-5dd8d4ade8a0","resolution":{"observed_at":"2026-08-08T22:50:34.539244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.527401Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"fcf5acb8-e56b-4dae-b4d3-9f23b1c602ca","year":2019},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.033876Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:dbe9c9f155498a8ef4c00df4a0c077b7ea8ede7b417dd0704ff780eaab184523","observation_id":"d9a6a78b-3850-451b-a8f8-8d996de70a2f","resolution":{"observed_at":"2026-08-08T22:50:34.530725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.519219Z","title":null,"venue":null,"work_id":"a22f5b49-d937-4f81-8b22-d0e2e62c8c7c","year":2021},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.037606Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:05e26414106402a9edfc5069f1d18492b8128818ba3be3585710275d44a705ee","observation_id":"445f83e8-9890-4e60-9939-858eafe69d29","resolution":{"observed_at":"2026-08-08T22:50:34.522130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.510834Z","title":"Scaling laws for neural language models","venue":null,"work_id":"d242c3d5-19b4-422c-a2a5-1d5dda80f5de","year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.040612Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ed79f16796b39d552777dd4b9297492841029dc3e456ce568254057e7f799ce6","observation_id":"834dc572-89e9-4b65-8a16-51917ffbe58c","resolution":{"observed_at":"2026-08-08T22:50:34.513941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.501789Z","title":"One weird trick for parallelizing convolutional neural networks","venue":null,"work_id":"193149ae-7a8b-4825-b29a-0c5a4af5d525","year":2014},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.043514Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:8fb443a2913efd4d2de09b62fb63120cdf0e16e496d452cb2cc3194f02fc7b11","observation_id":"4318d582-b797-4984-95ff-7d4fa607f897","resolution":{"observed_at":"2026-08-08T22:50:34.505067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.492707Z","title":"Implicit under-parameterization inhibits data-efficient deep reinforcement learning","venue":null,"work_id":"da37ac77-92e5-4464-94e3-974a43ef7151","year":2021},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.046258Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:6faeab48972d484a587c658c8381e32da0d9ebbe11ed6f7b48ed513fda573b3a","observation_id":"45af0646-657e-42e6-81ce-8e5607ea19d4","resolution":{"observed_at":"2026-08-08T22:50:34.496003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.483651Z","title":"DR3 : Value-based deep reinforcement learning requires explicit regularization","venue":null,"work_id":"1decb63b-b39f-4802-87f8-a7c18dc2a0b4","year":2022},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.049833Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:37b59b2b828487f2603ebb908f9edef3f1fc75382db08c779a485775165f4203","observation_id":"6d8cd011-d773-4ed7-a2bf-4ba6b7b85091","resolution":{"observed_at":"2026-08-08T22:50:34.486942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.474342Z","title":"Offline Q -learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"3fa50244-8911-4058-aa58-143c423d308b","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.052642Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:a893b76d27fd599fda0234de0aca0ecfcdad8d248c5b6f2c34b75aeecd91cdc0","observation_id":"2d7d541c-d0e3-4144-b23a-b5ac511ae60d","resolution":{"observed_at":"2026-08-08T22:50:34.477670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.465366Z","title":"Plastic: Improving input and label plasticity for sample efficient reinforcement learning","venue":null,"work_id":"8b1be65b-3859-44da-b427-f0de9b7bd29d","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.055443Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:8d7cb7f2698f4f7f67e0144023ba1716716821a27dd94af66f15053e2245da63","observation_id":"a77f9a6a-8821-42b1-8285-193d73da3323","resolution":{"observed_at":"2026-08-08T22:50:34.468705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.456363Z","title":"SimBa : Simplicity bias for scaling up parameters in deep reinforcement learning","venue":null,"work_id":"2f8330e6-7f81-4b03-a857-823840bb56c1","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.058595Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:58e126eb1784a227b53ece9b0179d83c6d1d8cb653f515c3d79f2d772ae44e51","observation_id":"42100522-0b73-4742-a361-b3e43167bb73","resolution":{"observed_at":"2026-08-08T22:50:34.459855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.061981Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.061981Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:928c98f6566be06e2731b76a55aa2c8bf13c57838f42f420b9af961f188f1310","observation_id":"3aaa09b1-f44e-4579-bef2-a6aa6218ac8a","resolution":{"observed_at":"2026-08-08T22:50:34.061981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.442761Z","title":"Efficient deep reinforcement learning requires regulating overfitting","venue":null,"work_id":"8c96c2aa-0456-4423-887b-cafa547e1024","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.064627Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:795b9807e25c02060b63fcac5338c0dd4771c22abca0db98af3859fbb8eb92a7","observation_id":"6f7126d6-f226-4751-9d6f-f5391b2d76eb","resolution":{"observed_at":"2026-08-08T22:50:34.445968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.433310Z","title":"Parallel Q -learning: Scaling off-policy reinforcement learning under massively parallel simulation","venue":null,"work_id":"e9ae432c-fd47-4fa7-88c8-ce3fb8b4738e","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.067376Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:0b0bfd9363c588e971bc72ba00c175191887e3d1c1e4d1e3b652f4411526eb33","observation_id":"8123446f-328a-45db-ac53-6d0b50893b5b","resolution":{"observed_at":"2026-08-08T22:50:34.436750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.424434Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":"b58e7621-e08a-4646-8064-714f581a28e1","year":2016},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.070061Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:326857b64d6fdc51b63072539181ff1e4d0935387fdd86d80b9ae8db29c59350","observation_id":"da99da43-bab3-4570-aadd-b9f5ac7bc6b6","resolution":{"observed_at":"2026-08-08T22:50:34.427523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.415469Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":"2586016e-89f0-4a38-918e-ee71219ac92a","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.072762Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:0a74a1b88666450db324967107caf1887f7508cc0a27bdaf92699c64f530fea4","observation_id":"84f79e94-a75d-49cf-b86f-7c976fd631aa","resolution":{"observed_at":"2026-08-08T22:50:34.418696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.406613Z","title":"Understanding plasticity in neural networks","venue":null,"work_id":"92f9eff6-ef63-4ec9-b8a1-d3b98d03cc12","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.075389Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:0dbd2def8ffeef61450904a9bb63e91b40232ae8ca1d80ca40c410d260782fe9","observation_id":"95c8a962-f99a-4380-b627-72f3c86d5438","resolution":{"observed_at":"2026-08-08T22:50:34.409854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.397888Z","title":"Isaac Gym : High performance GPU -based physics simulation for robot learning","venue":null,"work_id":"6de22e5d-a3ee-4432-837c-2af44fe65e2d","year":2021},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.078156Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ca89e81da3ea51243353901510b6c5e993d5a58b575735fded8b7a4398d20313","observation_id":"420e74c0-e1dd-4c9d-bd63-330696925885","resolution":{"observed_at":"2026-08-08T22:50:34.401201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.388906Z","title":"An empirical model of large-batch training","venue":null,"work_id":"b56b7af8-843f-4916-a4e6-63e5cac6475f","year":2018},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.080820Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ad3a57b03e2e13835c854bb3e9fa6610cc68454d2f607aead657ff51b959f79d","observation_id":"0d76c8ba-933a-4a8e-8993-da19d8bfa3d0","resolution":{"observed_at":"2026-08-08T22:50:34.392251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.083679Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.083679Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:487502a821f75020939e15427596da7361aa74f2c7106e217b0a04755db614d5","observation_id":"48466706-5f65-4e81-9dc2-308b1bd52c5e","resolution":{"observed_at":"2026-08-08T22:50:34.083679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.375497Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"8fd56dcd-6bee-4dff-b3d8-c49ab05fe732","year":2016},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.086479Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:8b92ba2d505aea0d649c9b1da71661bda1a61ec258c22c761bad4d12ebb86faf","observation_id":"f3dbbb1e-7b6f-4a92-bbf1-8f16247f1a65","resolution":{"observed_at":"2026-08-08T22:50:34.378538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.366262Z","title":"Scaling data-constrained language models","venue":null,"work_id":"3557c5d2-2d12-476b-b037-58cf4a8078fc","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.089206Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:857767398f3e0f1ec467fcf024b02c6e36ee3a6098ffd3bdfc42da36cb03b0e0","observation_id":"ee438f56-4ef8-409c-904c-0dbf3daf1055","resolution":{"observed_at":"2026-08-08T22:50:34.369315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.357434Z","title":"Overestimation, overfitting, and plasticity in actor-critic: The bitter lesson of reinforcement learning","venue":null,"work_id":"24e5c02c-7f8e-4e50-8aea-988d9004eef0","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.092049Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:1a92bf771c41af9eb5eca0f7f51cad42902a086fc05d72fb0cc0710905bec9a9","observation_id":"0c005f43-a340-46aa-a5df-b1260383fd20","resolution":{"observed_at":"2026-08-08T22:50:34.360790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.348542Z","title":"Bigger, regularized, optimistic: Scaling for compute and sample-efficient continuous control","venue":null,"work_id":"9194d309-8141-46cb-b422-97d1f81bfaa2","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.094759Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:8a8cb52e9301615952c864a98e9ff771cce237a976ce6df167a6c938fde01af0","observation_id":"3da14635-a3a1-4516-bf12-8fb94a1243ee","resolution":{"observed_at":"2026-08-08T22:50:34.351722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.339589Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"ccf767f6-21b5-48fe-b419-8ad7ac4481f0","year":2022},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.097737Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:6fd4a4bd2136b846e1effff15054b1b64e511b3313542912c61303ed2872b883","observation_id":"15f7c4a0-458e-488e-b1be-109c74191160","resolution":{"observed_at":"2026-08-08T22:50:34.342821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.330646Z","title":"Is value learning really the main bottleneck in offline RL ? Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":"79d9ebdd-7a4d-42bb-a021-a6c466cda4fc","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.100435Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ed3d63c3f5537b6b7d358f76ab5b7907c9b5109eb80cedfab4593a2b4845fa64","observation_id":"1b2963ce-248d-4e98-8dd4-4600f46c7c7b","resolution":{"observed_at":"2026-08-08T22:50:34.333902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.321649Z","title":"Hierarchical text-conditional image generation with CLIP latents","venue":null,"work_id":"8a310261-0e27-4a67-871f-341f7ce5023d","year":2022},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.103094Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ad428e71b2d3cf0ce120bd105a5f5a4e259164868b51a8f9efbe3ea4f022015d","observation_id":"a1946095-49fa-4c8a-bbef-b856df7aba23","resolution":{"observed_at":"2026-08-08T22:50:34.325067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.312603Z","title":"Mastering Atari , Go , chess and Shogi by planning with a learned model","venue":null,"work_id":"6baecd4c-6992-4760-a1a1-079782a239ef","year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.106006Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:2782b309e26a607173bf43fe2ad2ea85247c98497e48b095684c55cbfb846c62","observation_id":"2e36fc28-0661-4ad9-bcd8-81ada1a772bb","resolution":{"observed_at":"2026-08-08T22:50:34.316118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.108691Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.108691Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:ebcb59b2c1fb5ac8d20b9b33336b2ed702c63fe57dbbd8d82bb3dc11bcd5896c","observation_id":"9f4e15e0-c640-431a-9fb8-700b030b5344","resolution":{"observed_at":"2026-08-08T22:50:34.108691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.298928Z","title":"Bigger, better, faster: Human-level Atari with human-level efficiency","venue":null,"work_id":"20f62611-906d-47df-9ef3-61330feaa356","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.111324Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:9f0777321367ca41cf95fd573b6464de27f94113fc9ee5de248b46bb43646f6f","observation_id":"449bf428-f076-4b1c-94f1-bb0404809cd8","resolution":{"observed_at":"2026-08-08T22:50:34.302091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.113924Z","title":"Mastering the game of Go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.113924Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:62b2d44b9ca9adb9ca9dde30aad7f72f6ca4484d82e5a94636ebb95d602ec4c5","observation_id":"5a430338-03f3-4ad6-b4c5-a34cd3733eec","resolution":{"observed_at":"2026-08-08T22:50:34.113924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.285436Z","title":"SAPG : Split and aggregate policy gradients","venue":null,"work_id":"530082c5-79b1-4fd2-b09b-05a3a1bc1538","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.116676Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:a4f1e2876a5b9a975248f2fe682110902fe97747e64bd0ba1969a9803c9a2d6c","observation_id":"3eaa4bac-7c82-40f6-b3df-9b940bd3a4d9","resolution":{"observed_at":"2026-08-08T22:50:34.288447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.276985Z","title":"The dormant neuron phenomenon in deep reinforcement learning","venue":null,"work_id":"b3b86e69-310d-4935-8f33-a275d5a212d1","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.119692Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:008d9714b143b3a9dcbff6d962c2e95010709ccd77a84ed781126dcbb262d75e","observation_id":"13a14c9a-0a6f-42c0-a627-5d31545b7602","resolution":{"observed_at":"2026-08-08T22:50:34.279987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.268547Z","title":"Offline actor-critic reinforcement learning scales to large models","venue":null,"work_id":"ba984688-38a2-4bb5-aaf5-88edf21b1d2e","year":2024},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.122488Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:1dce18dc40540361f2d75b27a48ea7e1cfe82a15dc1c8a082ad57dff1fea93db","observation_id":"d880c06a-a724-438d-887c-f8e3e5ce3455","resolution":{"observed_at":"2026-08-08T22:50:34.271721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.259820Z","title":"Reinforcement Learning: An Introduction","venue":null,"work_id":"224cfff6-937f-491c-bfd6-3909354e7267","year":2018},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.125185Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:0024517b20b6d5fb020c3c2c57884d5984d53a2732dd26090b805317a947ebc9","observation_id":"c808fa9a-2d26-4506-a96a-d5b8cf981156","resolution":{"observed_at":"2026-08-08T22:50:34.263108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.251104Z","title":"DeepMind control suite","venue":null,"work_id":"43a8f659-09b1-4f30-b99d-6ad319ccc800","year":2018},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.128913Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:824d1caf2eb80f067e4cd62b6fbc39b0a2b341699501f506cdb674e56ec4f088","observation_id":"fde0c6e6-6d02-4df5-af67-dbcdad5eef6b","resolution":{"observed_at":"2026-08-08T22:50:34.254228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.241995Z","title":"Gemini : A family of highly capable multimodal models","venue":null,"work_id":"dbf1cae8-87c8-4f54-95e9-a4a85bb1231d","year":2023},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.131743Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:05e3ffe02bf2e81552a5d9b1ed4fcf3f3a511ae195d039d0e7076309953fc1da","observation_id":"4f5daa81-71cf-47e6-9a55-6a1aa11b9cef","resolution":{"observed_at":"2026-08-08T22:50:34.245209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.233007Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":"e6f529d1-cb2b-4c5e-8e51-47bca42e2998","year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.134688Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:8e07081dbec0722be22e47118d23d52c270f025e2c35c3af0f42b83404d007b4","observation_id":"a61064de-eb67-4b09-9730-3f2f821f42e5","resolution":{"observed_at":"2026-08-08T22:50:34.236045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.224298Z","title":"SciPy 1.0: Fundamental algorithms for scientific computing in Python","venue":null,"work_id":"118d93be-7e1e-4a0d-97cf-3a6f68c8c7ff","year":2020},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.137501Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:09a9dfef8fafedae9f1d19e3bd64de764bcff4de6d0ae3019d7036740080128c","observation_id":"2e34445f-b5a9-4d6f-afdb-e3684d360775","resolution":{"observed_at":"2026-08-08T22:50:34.227606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19668","last_updated":"2024-02-14T03:56:25Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T15:50:56Z","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19668","snapshot_observed_at":"2026-08-08T22:50:34.140276Z","title":"Drm: Mastering visual reinforcement learning through dormant ratio minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.140276Z"},"links":{"cited_paper":"/paper/2310.19668","citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:087f41a2b045552740dba5108e1a6204af7058eb27b9c3039cc6f4d922cc512b","observation_id":"4eff357b-0b1b-4dae-9a4b-5508821a0fdc","resolution":{"observed_at":"2026-08-08T22:50:34.140276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.215172Z","title":"Tensor programs V : Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":"1db3d081-e7fd-410b-91fc-c6aed8418d52","year":2021},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.143693Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:4e537ca876c606e64baa38b486e5f1f2c75bbb93d5ac8361d6b803142755e7ee","observation_id":"de0631a8-5a78-4ab3-8c53-81235939c286","resolution":{"observed_at":"2026-08-08T22:50:34.218727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.204115Z","title":"How to leverage unlabeled data in offline reinforcement learning","venue":null,"work_id":"d6f2c063-1bc0-499b-916b-a3f66b7e6515","year":2022},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.146473Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:fa38b32dc7e5bf95a6b28519ca69c5b7e2261c4176de45b6145683099bd334a9","observation_id":"3c1fa771-e5cd-4d0a-979f-d37b620ecc1a","resolution":{"observed_at":"2026-08-08T22:50:34.209081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.149185Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.149185Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:382f183c9677cfc43a64bc0149188946a317d6ec4a335aa0b221376e0328daac","observation_id":"b2c92c87-3905-4123-b6a1-b0bbf2073a2d","resolution":{"observed_at":"2026-08-08T22:50:34.149185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.152692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.152692Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:a0a1087071217cda9dc7bee014b3b6f695c57de3f55d2769b17644ce214d568c","observation_id":"a06c7c6a-6d48-47bf-a2db-61889dbf1be1","resolution":{"observed_at":"2026-08-08T22:50:34.152692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:50:34.155640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:50:34.155640Z"},"links":{"citing_paper":"/paper/2502.04327"},"observation_digest":"sha256:490aa59a1065e3815e1542327008e3dc20c98dc151672491a739b897e0cb95fc","observation_id":"5295faeb-a8ea-4c43-854e-c51d9f0ff23c","resolution":{"observed_at":"2026-08-08T22:50:34.155640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:40:54.869290Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 5 inbound Pith citation observations for arXiv:2502.04327."}