{"as_of":"2026-08-09T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c5d13f2fa14fbfa8be467f3ff76c8f518fdcd798c26e102f06ef2ef9c878cd2","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:32:20.217328Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:06.014406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:46:27.860463Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07523","snapshot_observed_at":"2026-08-06T04:39:06.014406Z","title":"Scaling off-policy reinforcement learning with batch and weight normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.014406Z"},"links":{"cited_paper":"/paper/2502.07523","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:ff04d4d7257fb0d4d0112c85ba45a443a552a6c4615a91493954e34e945058ca","observation_id":"47bb1096-30d7-43a5-a96a-02dbf597181b","resolution":{"observed_at":"2026-08-06T04:39:06.014406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"cited_work":{"arxiv_id":"2502.07523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07523","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling off-policy reinforcement learning with batch and weight normalization","venue":null,"work_id":"3d775a8d-5923-498f-8fc0-459f008f96fb","year":2025},"citing_paper":{"arxiv_id":"2604.18978","last_updated":"2026-05-07T15:47:31Z","snapshot_observed_at":"2026-08-08T15:22:09.895907Z","submitted_at":"2026-04-21T01:59:54Z","title":"Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:22.577012Z"},"links":{"cited_paper":"/paper/2502.07523","citing_paper":"/paper/2604.18978"},"observation_digest":"sha256:ed26c9d9bd0a6b2a3c18233bd7991d16eee099bc76243451811dddacc9c65471","observation_id":"8e5df350-6c5b-40a5-8584-b9664a6ecbbb","resolution":{"observed_at":"2026-05-11T12:46:27.863900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"cited_work":{"arxiv_id":"2502.07523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07523","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling off-policy reinforcement learning with batch and weight normalization","venue":null,"work_id":"3d775a8d-5923-498f-8fc0-459f008f96fb","year":2025},"citing_paper":{"arxiv_id":"2605.04368","last_updated":"2026-05-06T00:10:17Z","snapshot_observed_at":"2026-07-06T23:17:09.246351Z","submitted_at":"2026-05-06T00:10:17Z","title":"Extending Differential Temporal Difference Methods for Episodic Problems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:57.472765Z"},"links":{"cited_paper":"/paper/2502.07523","citing_paper":"/paper/2605.04368"},"observation_digest":"sha256:70b99d95a907d37ffbea76ad47b7cdd32ec9fbfc44de78a457bac1340c7f2177","observation_id":"a3db05dd-9295-402a-bc36-ca5c22c7c0fe","resolution":{"observed_at":"2026-05-09T06:35:38.842202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07523/citation-record","integrity":"/paper/2502.07523/integrity","json":"/paper/2502.07523/citation-record.json","paper":"/paper/2502.07523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.103797Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"96ba8301-9281-4359-ac2e-7faf214663ae","year":2021},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.945704Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:cc5559877bd6526c2d8162f6a59de98521a464e9ffcc8d4ac1e6338500b7812e","observation_id":"75263cad-6299-44ef-8c73-abf37c6bf9d1","resolution":{"observed_at":"2026-08-08T12:32:21.108258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08475","last_updated":"2020-12-31T07:58:30Z","snapshot_observed_at":"2026-08-06T20:49:48.460817Z","submitted_at":"2019-10-18T15:35:59Z","title":"On Warm-Starting Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08475","snapshot_observed_at":"2026-08-08T12:32:19.951110Z","title":"Ash and Ryan P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.951110Z"},"links":{"cited_paper":"/paper/1910.08475","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:2618a8e1702d5553506f555c992c6f92947daf1546fd7ad06656e11cda0c3a4c","observation_id":"ed9c9d59-5e49-495c-961c-2af5be4e7484","resolution":{"observed_at":"2026-08-08T12:32:19.951110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T12:32:19.956080Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.956080Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:0eeab58d557d65ef26bcf36efc436c9497ec48bdb641da0a59cd2407a08cce35","observation_id":"c9f6ac76-8cfe-462c-bf34-87e6816846f2","resolution":{"observed_at":"2026-08-08T12:32:19.956080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.090493Z","title":"CrossQ: Batch normalization in deep reinforcement learning for greater sample efficiency and simplicity","venue":null,"work_id":"1f76b7ec-202c-4371-988d-ae0cc931b2d7","year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.960996Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:39c60367efed226953f28c55915a0f62740c110290284f7099c012870a16f840","observation_id":"0c7b4c7d-f0f2-4df3-be89-633f0f8faffb","resolution":{"observed_at":"2026-08-08T12:32:21.094998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01151","last_updated":"2022-01-03T22:38:41Z","snapshot_observed_at":"2026-08-09T12:23:00.915557Z","submitted_at":"2021-06-02T13:41:02Z","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01151","snapshot_observed_at":"2026-08-08T12:32:19.966074Z","title":"Gomes, and Kilian Q","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.966074Z"},"links":{"cited_paper":"/paper/2106.01151","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:7bbec08ead8f4e6d47ad3987af99ec83f0b937d1a024801f90059e801c2bfc55","observation_id":"d6659d78-ad05-4bb0-a86d-47dacf7dba7b","resolution":{"observed_at":"2026-08-08T12:32:19.966074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08375","last_updated":"2025-08-12T13:36:13Z","snapshot_observed_at":"2026-08-07T17:13:08.252540Z","submitted_at":"2025-03-11T12:32:06Z","title":"Gait in Eight: Efficient On-Robot Learning for Omnidirectional Quadruped Locomotion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08375","snapshot_observed_at":"2026-08-08T12:32:19.970952Z","title":"Gait in eight: Efficient on-robot learning for omnidirectional quadruped locomotion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.970952Z"},"links":{"cited_paper":"/paper/2503.08375","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:d9bc8827df67d6fdcde77f39a00109ed0fbde97016abbb5b602d3442c95addcf","observation_id":"18e046cc-1d8e-4d19-aa0e-5d1a8422f4c5","resolution":{"observed_at":"2026-08-08T12:32:19.970952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13600","last_updated":"2022-05-26T20:11:23Z","snapshot_observed_at":"2026-07-06T13:14:26.331614Z","submitted_at":"2022-05-26T20:11:23Z","title":"MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13600","snapshot_observed_at":"2026-08-08T12:32:19.976294Z","title":"Myosuite–a contact-rich simulation suite for musculoskeletal motor control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.976294Z"},"links":{"cited_paper":"/paper/2205.13600","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1041d64ee49ce108d27e1482ed28af1ed0723354e95a33642a48121dabee5500","observation_id":"ef71f28d-42d5-40fc-97f9-c1beb070e77a","resolution":{"observed_at":"2026-08-08T12:32:19.976294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.076775Z","title":"Randomized ensembled double Q- learning: Learning fast without a model","venue":null,"work_id":"d0fda641-1d08-450e-ab32-fb7f2e4065ff","year":2021},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.980914Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:4fc58eba9e507cafd5d619e9a6f72c2e6a128eb0fe877129e9fdae0f7f1448b3","observation_id":"b7e4f8f6-24f0-4a9f-a7ae-39ec91ea58a0","resolution":{"observed_at":"2026-08-08T12:32:21.081159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.063049Z","title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","venue":null,"work_id":"e2a4e625-4d96-479d-86f9-976b4920a6de","year":2022},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.985373Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:fae4c1121ddb7befa128cca6fcbbb55d90e73285d404c1b83059628ea3008d0c","observation_id":"352a4d70-af65-4ce7-ada4-5c408307db7a","resolution":{"observed_at":"2026-08-08T12:32:21.067453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.049724Z","title":"Weight clipping for deep continual and reinforcement learning","venue":null,"work_id":"812e368a-9b50-4e91-848f-e09da314d2d3","year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.989742Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:880497f51641ab2338c346595288426a5bb75885367445d84049a0b0b597e376","observation_id":"b7388153-db91-4c99-bf03-b1b9f5fc9d3b","resolution":{"observed_at":"2026-08-08T12:32:21.054193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.036523Z","title":"Jordan, Joseph E","venue":null,"work_id":"fd4c5f29-c565-4351-b4bd-4f3a9efc5ed3","year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.994044Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:3c54e3eb904a5fe1b504bc99783ae809f9de5c8fc59cc9447cca8e4b114d7401","observation_id":"124445d9-ca17-48a4-ab62-79762922e9e2","resolution":{"observed_at":"2026-08-08T12:32:21.040767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.023179Z","title":"Sharpness-aware min- imization for efficiently improving generalization","venue":null,"work_id":"c59c32ec-05b1-4a2c-9737-99ef814e1b65","year":2021},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:19.998499Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:9a7a5e57c16072d186a6598ae93bad94457f50a995090a62a9a083331791e69d","observation_id":"bc1bb07f-f41d-4ef8-80ef-5542c77c39cf","resolution":{"observed_at":"2026-08-08T12:32:21.027624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-08T12:32:20.003004Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.003004Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:d346bd66bd796ea14912741367e25612114e3e3ccbe3a18ba280362578808996","observation_id":"93bc73ee-9cbb-49af-b36a-1a4d74c1b7c1","resolution":{"observed_at":"2026-08-08T12:32:20.003004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:21.009531Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"14d76faa-9cdd-4acb-b95f-6d61b17ad97d","year":2020},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.007777Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:bacf5d2b846dca11ccd62590920741c7c5e5f934144d53f6b959add3d58ae968","observation_id":"890de0fc-32be-4f12-9a3f-9a323e487a83","resolution":{"observed_at":"2026-08-08T12:32:21.014128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-08T12:32:20.012049Z","title":"Td-mpc2: Scalable, robust world models for continuous control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.012049Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:efb61198b8c0b949d9b41c4410547710672673f7760ce2b5815eca26a216cfb5","observation_id":"ab10e9bd-6f4a-4044-ab68-b771cc5d82d0","resolution":{"observed_at":"2026-08-08T12:32:20.012049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.995888Z","title":"Learning continuous control policies by stochastic value gradients","venue":null,"work_id":"d09d1ea4-b3d9-42f3-88b7-3a9973ee72f4","year":2015},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.016563Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:0ea59d2360eb512ccd53239bf6b8786e25e967037499cda77f8ead8e3af83867","observation_id":"d95cfb06-dee2-455e-815e-27f16afdc36a","resolution":{"observed_at":"2026-08-08T12:32:21.000354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.982142Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":"4db5dd90-4b1a-4bc5-81c7-ba6a93898bcb","year":2021},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.020759Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:c6fcd57c014fcea50927716070dd1a6397b27ac56fd69387e934bffdb68f94ea","observation_id":"775bbe21-ce93-4a3f-99e7-d3fe6ff23a9a","resolution":{"observed_at":"2026-08-08T12:32:20.986639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.968167Z","title":"Normalization techniques in training dnns: Methodology, analysis and application","venue":null,"work_id":"efa4adb0-0751-440e-a8f7-2cc1c4215214","year":2023},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.024954Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:79a3aef1fc14b081c4744fdbc38c0bc2cc6ce4b09dec1f5e43351b4d9d9793da","observation_id":"35af7e7d-9a2a-44d5-a273-7c282b4b0a45","resolution":{"observed_at":"2026-08-08T12:32:20.972649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05996","last_updated":"2024-08-05T11:55:19Z","snapshot_observed_at":"2026-07-06T17:42:03.971883Z","submitted_at":"2024-03-09T19:56:40Z","title":"Dissecting Deep RL with High Update Ratios: Combatting Value Divergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05996","snapshot_observed_at":"2026-08-08T12:32:20.029295Z","title":"Dissecting deep rl with high update ratios: Combatting value overestimation and divergence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.029295Z"},"links":{"cited_paper":"/paper/2403.05996","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:f9906ef0f1784058598b2e8cf05bb100f0784ff666b1d764f360b476cb37328d","observation_id":"9a1b4d42-adff-45e9-8b04-bdba794b3256","resolution":{"observed_at":"2026-08-08T12:32:20.029295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-08T12:32:20.034194Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.034194Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:4844a531d4339f42817b81b221dad4f12df75e708f045e062ba3c05d3b7a65b5","observation_id":"158c42e5-cd72-4b2b-83fa-4e16bf8ffe27","resolution":{"observed_at":"2026-08-08T12:32:20.034194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.954054Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"642ccf02-7a97-4180-beaa-87724b0a8215","year":2019},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.038685Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1b81ddf0346f01101f408f30c94431829655c0f3ad365926f91671459ae96ddd","observation_id":"7a1ea665-fb5e-450e-b8d6-b77cebc78778","resolution":{"observed_at":"2026-08-08T12:32:20.958602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2019/379","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.248220Z","title":"Deepmellow: Remov- ing the need for a target network in deep q-learning","venue":null,"work_id":"752751be-4d59-43e3-b4c2-6a1ef77b2a67","year":2019},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.042944Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1e48473e2b69e8c48cdc376e735ffcfd79c08a0012f16f397a485e8a435cf808","observation_id":"d7cbeaed-d115-4233-8cca-5a863f876ad7","resolution":{"observed_at":"2026-08-08T12:32:20.254991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:32:20.047225Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.047225Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:4baf5c9ac61f7d11ee1bf1ae27988c3a709e7ac02c5edd1c81ef53b6b210aff2","observation_id":"582992de-d84e-4821-a9eb-6b892d79df62","resolution":{"observed_at":"2026-08-08T12:32:20.047225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.939970Z","title":"JAXRL: Implementations of Reinforcement Learning algorithms in JAX, 2021","venue":null,"work_id":"9c5f9e6e-9eef-481e-8cb6-ffc801bb5f44","year":2021},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.051755Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:790c7883ea7b8c203e6832679e486d44a2d2bbb9d3355a3bde153bc3c6eab8b3","observation_id":"ef0d8d24-004f-4f43-8235-6b05288739c5","resolution":{"observed_at":"2026-08-08T12:32:20.944655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10711","last_updated":"2023-12-08T21:12:47Z","snapshot_observed_at":"2026-07-06T15:44:04.779448Z","submitted_at":"2023-06-19T06:14:51Z","title":"PLASTIC: Improving Input and Label Plasticity for Sample Efficient Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2306.10711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.10711","snapshot_observed_at":"2026-08-08T12:32:20.374524Z","title":"PLASTIC: Improving Input and Label Plasticity for Sample Efficient Reinforcement Learning","venue":"cs.LG","work_id":"b5c6aa2d-2cb8-4175-ac55-2ef02ae53bbb","year":2023},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.055893Z"},"links":{"cited_paper":"/paper/2306.10711","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:85057a22e2d5d7552a0411b52800009b8f3bd9b0348bf167c52e63a01e885617","observation_id":"0518ed5d-c1aa-4997-a5c8-434f8fe814ff","resolution":{"observed_at":"2026-08-08T12:32:20.379411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.924256Z","title":"Simba: Simplicity bias for scaling up parameters in deep reinforcement learning","venue":null,"work_id":"8efab05c-5d0d-4fed-9fa1-b494652c25a2","year":2025},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.060235Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:e9f1ca27ea2a21dbeadc76bf72456c86c68ce4d57097dd11509e4fbcd81e21c8","observation_id":"615629a0-8983-4261-a4d4-9821c9b73eb1","resolution":{"observed_at":"2026-08-08T12:32:20.929383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.909085Z","title":"Efficient deep reinforcement learning requires regulating overfitting","venue":null,"work_id":"8beb121b-4891-4c65-868d-d1ccb756d5da","year":2023},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.064502Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:07f8f9883351893757e95b1f5b5b308ffbd7af26dd40c624b3557b5f178d55e2","observation_id":"9b1a5874-9527-46ec-95fa-62312d3922b7","resolution":{"observed_at":"2026-08-08T12:32:20.913730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T12:32:20.068947Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.068947Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:9be27fe169e34866b80acd41a4e2531bed10d95bd3882db7c51068c77cdb5cb3","observation_id":"446266a6-c383-4f5f-abad-5374223ee8e8","resolution":{"observed_at":"2026-08-08T12:32:20.068947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.894544Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":"dd3e7434-7d56-492a-9051-aaeca3cea11c","year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.073266Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:d7d81af2eb5a067d51b79febdf6f19dd3f259cba65cbcfc0c8e6d23bf33f717d","observation_id":"a60866d2-054b-4aac-8e9d-4fe2dc0984d7","resolution":{"observed_at":"2026-08-08T12:32:20.899444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.880402Z","title":"Grokking deep reinforcement learning","venue":null,"work_id":"376cafd9-7cc6-4320-a889-349a668c2504","year":2020},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.077446Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:5e55e227a2cec44f3b97b23daf20f6a11f7499ad9825085d03f4fa3866c33a68","observation_id":"9320d514-4261-4ba8-abd5-d14d6e858fb2","resolution":{"observed_at":"2026-08-08T12:32:20.885023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.866319Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":"939641af-42f1-47b6-bd34-7adc7e47f104","year":2024},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.081605Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:a8c08c73b36e8b91b5710869b8ca855bd69953d704843725ccda7b3f6b6b5637","observation_id":"db7f85ff-004f-48e8-a4ae-a052922d4b62","resolution":{"observed_at":"2026-08-08T12:32:20.871019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.852090Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"84ec4103-3a8c-4d89-aeb5-87a26ffc2d9a","year":2022},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.085717Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:d8fb671cb30a979eb0685d9594b40aacf51bfb72227205a087cb63ed66caa946","observation_id":"6a3bb533-3354-42f0-985f-4d7d98cb4fa0","resolution":{"observed_at":"2026-08-08T12:32:20.856594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09464","last_updated":"2018-03-10T18:11:25Z","snapshot_observed_at":"2026-08-02T00:57:15.173797Z","submitted_at":"2018-02-26T17:20:14Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09464","snapshot_observed_at":"2026-08-08T12:32:20.089815Z","title":"Multi-goal reinforcement learning: Challenging robotics environments and request for research, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.089815Z"},"links":{"cited_paper":"/paper/1802.09464","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:14e7418e1fc423a3131c70e84a61cdf8c812768ee43b48265f68b5acb9243718","observation_id":"1b22ac48-c03a-4651-bfbc-f025972209f3","resolution":{"observed_at":"2026-08-08T12:32:20.089815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.094222Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.094222Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1f30cd5278c229afe2b70446b8786c08a3c740862f050bba81d4bcd8606ee21c","observation_id":"05e9d014-9436-43f3-a179-b5527363d280","resolution":{"observed_at":"2026-08-08T12:32:20.094222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.828382Z","title":"Weight normalization: A simple reparameterization to accelerate training of deep neural networks.Advances in Neural Information Processing Systems (NeurIPS), 2016","venue":null,"work_id":"147204c0-bef9-40a0-ba97-661afc9b94cb","year":2016},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.098434Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:94a27fe02991a02ea5d722ecc44e20d598a16d387859f1f6414a42762a5a3257","observation_id":"79217d20-d803-4cfe-aea3-e7ed9c64138d","resolution":{"observed_at":"2026-08-08T12:32:20.833567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.814776Z","title":"Bigger, better, faster: Human-level atari with human-level efficiency,","venue":null,"work_id":"17308650-dcf2-4578-bb73-f4d78c299e62","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.102964Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:be755fed83024dce0b573629af592e4625d5ba2640e28afab01d879719d9df06","observation_id":"38f87664-07ec-495d-b6ea-79eb253619ec","resolution":{"observed_at":"2026-08-08T12:32:20.819182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.05201","last_updated":"2016-07-19T05:18:36Z","snapshot_observed_at":"2026-07-06T04:49:43.585767Z","submitted_at":"2016-03-16T18:17:36Z","title":"Understanding and Improving Convolutional Neural Networks via Concatenated Rectified Linear Units","version":2},"cited_work":{"arxiv_id":"1603.05201","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.05201","snapshot_observed_at":"2026-08-08T12:32:20.313381Z","title":"Understanding and Improving Convolutional Neural Networks via Concatenated Rectified Linear Units","venue":"cs.LG","work_id":"890dfb0a-6bd8-4bc5-ac8f-8ff0097ead82","year":2016},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.111782Z"},"links":{"cited_paper":"/paper/1603.05201","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:fe99150add6881eda5b3bb07b45a7104be0da720ef8b7e435e486f7aa40eeed7","observation_id":"bd82cf46-10db-4510-a472-7e36d58917e2","resolution":{"observed_at":"2026-08-08T12:32:20.318284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.801383Z","title":"Integrated architectures for learning, planning, and reacting based on approximating dynamic programming","venue":null,"work_id":"5bebf3a2-99f7-45ac-8976-d4fffa91ab7c","year":1990},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.116205Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:723dfa1afd8737c3ca6593fb8900c8430d6cccd3a374285d76d430acfb4fa249","observation_id":"ddccf2aa-fed1-4b33-ada8-97c587bf4b0e","resolution":{"observed_at":"2026-08-08T12:32:20.805994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.787768Z","title":"Sutton and Andrew G","venue":null,"work_id":"6f802e61-2265-41cc-8db9-054df1109c38","year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.120492Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:0c4ac3851189b0e0e71d4275aeda7082f5bfe3f062c03ebd13632f1861351d66","observation_id":"4e01e6f2-e993-479d-9e2c-a3a130f50738","resolution":{"observed_at":"2026-08-08T12:32:20.792552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T12:32:20.124594Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.124594Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:3db8a222d6d802a614cd5c7b30243666aefb1233d2fd0ecbe2aff90771e41002","observation_id":"6f15bc57-ea9e-49ba-816d-260ba7d40a00","resolution":{"observed_at":"2026-08-08T12:32:20.124594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.774037Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"24775501-a250-4823-852b-e238df8c27d3","year":2012},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.129108Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:c934d568a343291e784fd9ed3373d609bf26fe58781762ddceb86a271860a083","observation_id":"229608f7-4f96-43a3-b34c-32edd1ff9e11","resolution":{"observed_at":"2026-08-08T12:32:20.778523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.760404Z","title":"When to use parametric models in reinforcement learning? In Advances in Neural Information Processing Systems, 2019","venue":null,"work_id":"f2c53739-abc1-4864-a13d-720828386ce9","year":2019},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.133207Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:8c92784f58fbf843fc94e9f8ac8ff530fc93f61a7359eab44b13494ca2c059c6","observation_id":"e0aa07f3-b903-4b0b-a8ee-26b53270196f","resolution":{"observed_at":"2026-08-08T12:32:20.765022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-08-06T22:03:25.581947Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-08-08T12:32:20.137727Z","title":"L2 regularization versus batch and weight normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.137727Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:3d1ee1ce7f2049ab7fef56bcd648b52062d331a2e060ef4fc64abc952ae038ad","observation_id":"caed7d6c-b0b2-48a8-8a35-6c0e6eaba9a9","resolution":{"observed_at":"2026-08-08T12:32:20.137727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08896","last_updated":"2025-04-02T18:17:24Z","snapshot_observed_at":"2026-08-04T20:57:43.814693Z","submitted_at":"2024-10-11T15:13:17Z","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08896","snapshot_observed_at":"2026-08-08T12:32:20.142069Z","title":"Mad-td: Model-augmented data stabilizes high update ratio rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.142069Z"},"links":{"cited_paper":"/paper/2410.08896","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1a26a5143591040fd7c288433d1a09d9a65ede7dc1f89940bf66ad61dd42be6b","observation_id":"e034f50a-2aff-4ba1-806d-58df997a9bee","resolution":{"observed_at":"2026-08-08T12:32:20.142069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.746959Z","title":"Root mean square layer normalization","venue":null,"work_id":"ec6fd074-98ce-4a41-a20f-c89d1424e8ad","year":2019},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.146711Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:df5760e6e0e2dc6b0cc7c06c1b31b05c4252acf045a428a2bb18f11b0ebdc7a9","observation_id":"6c2e5cfb-aa5d-4209-abb3-c3fe1571c58a","resolution":{"observed_at":"2026-08-08T12:32:20.751348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.733592Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"ec6c8279-9dae-4c45-8180-e1ceac5c92ba","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.151181Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:3af4afde376a70b982679a479f3c6659d281f0cf103f457287ef650556ed7ac3","observation_id":"9174a6a3-46b7-43ed-9071-aad4835e0467","resolution":{"observed_at":"2026-08-08T12:32:20.738107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.720552Z","title":"Limitations","venue":null,"work_id":"0674eafa-3a7c-4e39-b52e-001a8e267626","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.155477Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:a771bc2ccdae93fcb87231dce68c273896e6996e30e05bb37eaff81dbe6f1bf9","observation_id":"714c4790-4185-46eb-9328-c49b541c7c85","resolution":{"observed_at":"2026-08-08T12:32:20.724724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.706850Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"a38f6944-c394-497c-832c-ef16981eac06","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.160017Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:418d532b6023c67793a11026b2c01d3e4924dd5e4f7c5634ba9a0055b5516afb","observation_id":"b3af780f-3a10-47f8-80fd-49a647ddfce4","resolution":{"observed_at":"2026-08-08T12:32:20.711119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.693359Z","title":"To aid reproducibility, we plan to release the code together with the camera-ready version of the paper","venue":null,"work_id":"104d3d7f-b689-43c8-bcf0-10eb98b9e2c1","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.164340Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:27397aba7f0aa2f862f448097f3277df0697677dd1b2438eced6e32e90f23599","observation_id":"c4887074-6461-48b7-b3bb-c3d71997bd38","resolution":{"observed_at":"2026-08-08T12:32:20.697899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.679273Z","title":"We plan to release the code together with the publication of the paper","venue":null,"work_id":"c562db66-a941-430d-b879-a702f31e893a","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.169410Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:c0695fdf18e838c134ac0f51ae0fa709baefff71e099e2d148c960dd0e2ff794","observation_id":"b674ce1f-a0e4-425e-9a69-476838c88c3c","resolution":{"observed_at":"2026-08-08T12:32:20.683917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.665864Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"bc2e4a1c-3a3f-4da4-b64c-515c7f2e08d9","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.174165Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:6486a34840e05457f8b8bdc8fa9c88fa641cb0628bcf57ef36e7a4efe1ccedec","observation_id":"fb87d9b0-aa13-4434-8428-bb10e92b1ccf","resolution":{"observed_at":"2026-08-08T12:32:20.670334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.652558Z","title":"Results are aggregated over multiple environments and 10 seeds each","venue":null,"work_id":"4eb31e4f-3935-4493-b10a-7ee54819fe6c","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.178258Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:0876b86810daabc5b5cd03b0e4c9f53e4528cb638a357ac3e4e96193d534f677","observation_id":"79634b99-c3fb-4dd3-bd36-d4f912570c3e","resolution":{"observed_at":"2026-08-08T12:32:20.656920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.637736Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"d02f4972-798a-4241-b952-b25f27081aa9","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.182482Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:9ff2a3cd692d34ed7e37436b9c10d26ed7133d6b82283a16d85b2ff7925258bd","observation_id":"81b417fa-0671-4dc4-aaa7-ce5973b1c6a6","resolution":{"observed_at":"2026-08-08T12:32:20.642686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.623020Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"7b835e93-16f8-4443-acc7-b5962a80e778","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.187026Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:d5a96af5a78d4e91e736ab765c9992868172f6cb52c79df9009c0609eb4deeb5","observation_id":"b74d57b4-a312-4725-91d9-032675b7d9cb","resolution":{"observed_at":"2026-08-08T12:32:20.627524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.609081Z","title":"As actor-critic methods already enjoy a long history, there is no additional societal impact with this research contribution","venue":null,"work_id":"0a516525-826f-4eaa-a248-ca96ad9a614e","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.191284Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:70fe2b8e283cdc42c0e8fa9abce5b0c648a4c7d10baf98335102f9258df645d9","observation_id":"73ed4cfe-9dba-41ea-8e2c-66046cbf7835","resolution":{"observed_at":"2026-08-08T12:32:20.613570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.595008Z","title":null,"venue":null,"work_id":"7ff747ab-1412-4928-b483-fe1f9653e417","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.195476Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:708d30dc8018272a7a9b26963770f9f26035838938aab8b1b6ef4b390e35d4c6","observation_id":"fbd4819c-cde6-425b-a14a-2103608adc12","resolution":{"observed_at":"2026-08-08T12:32:20.599457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.580738Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"b9f026ae-eb71-4bbe-bede-9afd00a4c26c","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.199803Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:22e8e232ea18e836a68caffb73ffabb14ee99c8695301e8e0b0f4f01fe71bcec","observation_id":"1cc4494b-c4ec-49df-94cb-8727302ce406","resolution":{"observed_at":"2026-08-08T12:32:20.585362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.566515Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"615f0fe1-e688-4b02-8ac1-57f4dd66fb41","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.204221Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:f8d2037f16fcf42fc12adcf63bcde007839b8ebcd985009c1aa09bce72e5316c","observation_id":"1659f625-38a3-477a-8cb6-ec380efaf8b4","resolution":{"observed_at":"2026-08-08T12:32:20.571135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.208772Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.208772Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:51481f2896b8c5e90dd92c5306a97a429b8f3dfecd999143197f078c55756554","observation_id":"58009948-31b4-4bdf-81cf-8cdde5f88573","resolution":{"observed_at":"2026-08-08T12:32:20.208772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.543516Z","title":"• Depending on the country in which research is conducted, IRB approval (or equivalent) may be required for any human subjects research","venue":null,"work_id":"a4debec9-dedf-4fd8-8056-f293cd8bf99d","year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.212997Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:5ec8dd20a7d744f54b813f2577f679f48a489193ba11b9344c84826e0adc7efb","observation_id":"c05b1cf6-fef2-4e2e-807c-e4aa83e6e252","resolution":{"observed_at":"2026-08-08T12:32:20.548252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:32:20.528748Z","title":null,"venue":null,"work_id":"ca946806-78cb-44d8-bf12-789163d6adc1","year":2025},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.217328Z"},"links":{"citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:e86695e35453bd8e56e047d73160551201f8a53591a8d37841127ab8a1b68a66","observation_id":"7a401270-6cba-409f-870d-c645450b258a","resolution":{"observed_at":"2026-08-08T12:32:20.533194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19452","last_updated":"2023-11-13T17:57:19Z","snapshot_observed_at":"2026-07-06T15:35:41.522547Z","submitted_at":"2023-05-30T23:23:25Z","title":"Bigger, Better, Faster: Human-level Atari with human-level efficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19452","snapshot_observed_at":"2026-08-08T12:32:20.107232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.107232Z"},"links":{"cited_paper":"/paper/2305.19452","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:1f70b59a6351d711008ef99e51a796ae1361fe94f793e7298a7021f64a743c8b","observation_id":"f2f1f8d1-f3ba-4ee3-a3e9-b0a4e6212f51","resolution":{"observed_at":"2026-08-08T12:32:20.107232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:25:21.333969Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":39},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 3 inbound Pith citation observations for arXiv:2502.07523."}