{"as_of":"2026-08-20T14:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7c9a51a12d7bf16ef18b272bfc836b36fff078759ca72dbba53e58e3a0b2a39","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:25:18.377948Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:03:31.098377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T05:25:54.539497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-08-06T11:03:31.098377Z","title":"Stabilizing reinforcement learning in differentiable multiphysics simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-17T21:31:33.201638Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.098377Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:aec05726d4ebffab051b0c1236d1ccba12dacd6af8e4ad89319ad102809cf7b5","observation_id":"e35af45e-1f0b-448d-b13c-8b2845a3e1bb","resolution":{"observed_at":"2026-08-06T11:03:31.098377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-08-05T13:55:19.235569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00215","last_updated":"2025-09-04T12:46:04Z","snapshot_observed_at":"2026-08-15T00:23:15.253590Z","submitted_at":"2025-08-29T19:55:25Z","title":"First Order Model-Based RL through Decoupled Backpropagation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:55:19.235569Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2509.00215"},"observation_digest":"sha256:11cc13ebb9da606e10e9d745a564b82158dc48a0487a667621dd3b183c161fce","observation_id":"0c47a33e-6ec9-4403-8350-7707d2faef05","resolution":{"observed_at":"2026-08-05T13:55:19.235569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-08-03T15:17:02.750342Z","title":"Stabilizing re- inforcement learning in differentiable multiphysics simulation.arXiv preprint arXiv:2412.12089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17534","last_updated":"2026-06-30T16:25:53Z","snapshot_observed_at":"2026-08-20T02:11:12.017600Z","submitted_at":"2025-12-19T12:58:06Z","title":"The HydroGym Reinforcement Learning Platform for Fluid Dynamics","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T15:17:02.750342Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2512.17534"},"observation_digest":"sha256:b4ecd557d71c121e3cbe14b09ee06a0971909abbdd4a666b9ef8e8881c45c9e9","observation_id":"d80812c7-5ba6-474f-8198-3150962b2a74","resolution":{"observed_at":"2026-08-03T15:17:02.750342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":"2412.12089","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stabilizing reinforcement learning in differentiable multiphysics simulation.arXiv preprint arXiv:2412.12089","venue":null,"work_id":"ab4dec7e-42c5-4a50-bd8c-2afb7dd7a345","year":null},"citing_paper":{"arxiv_id":"2604.18161","last_updated":"2026-04-20T12:23:48Z","snapshot_observed_at":"2026-08-16T03:20:06.008471Z","submitted_at":"2026-04-20T12:23:48Z","title":"Does \"Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:26.743531Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2604.18161"},"observation_digest":"sha256:477d71a15d687e0f035b4dd4b8cc758e338ed9e8b7157a8ef3cd157c7535dec1","observation_id":"838e404a-bdbb-41a5-8f71-374de83cc229","resolution":{"observed_at":"2026-05-10T05:25:54.541004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12089/citation-record","integrity":"/paper/2412.12089/integrity","json":"/paper/2412.12089/citation-record.json","paper":"/paper/2412.12089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.114672Z","title":null,"venue":null,"work_id":"aeecaafe-19b8-4f9f-98a0-f03f3294b342","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.291827Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:1457e617f5d0f503b65380409009840479e5c76f1949f268c54bab929fde7d26","observation_id":"7f41b60c-134a-4edd-8cc0-81846c39d9dd","resolution":{"observed_at":"2026-08-11T14:25:19.120281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.029465Z","title":null,"venue":null,"work_id":"e5d01c86-89fc-4e99-8efb-aab65a320771","year":2021},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.322804Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:59e46562d5a352797b3fcbe17e25f4ff948ff2d51ae4438d7571aa654d8df665","observation_id":"b419e46c-fec9-4f62-bd09-d8490d887d7b","resolution":{"observed_at":"2026-08-11T14:25:19.037570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-18T21:41:20.439669Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-11T14:25:18.111207Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.111207Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:0a7a79dc1b7d0f5449ce896e18ad6322915c4fafc5b8b7dd5d67995869e461a0","observation_id":"62afaa51-dc9b-4aa3-a093-68423ef2eef3","resolution":{"observed_at":"2026-08-11T14:25:18.111207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.981253Z","title":"We denote the goal state distribution ρ∗ if the task defines it","venue":null,"work_id":"549f9910-2d53-4773-8a50-f6873a701b6a","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.340367Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:56dbb1b55de5f3ac264d11b5b679a54c137223bf4eb3e2a998ed1e51127f74b7","observation_id":"f987b00d-d695-42eb-a626-7239356963ae","resolution":{"observed_at":"2026-08-11T14:25:18.987155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.355364Z","title":"Distributed prioritized experience replay","venue":null,"work_id":"65ed2b1a-c1df-4568-9d55-d7cd492a5c03","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.134424Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:634ab4d6c18f26bb92f448390e874d5cad794500eed97759701027a3b0821a3e","observation_id":"8ac1a36d-75db-4e93-94ff-913231d78237","resolution":{"observed_at":"2026-08-11T14:25:19.362611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00806","last_updated":"2025-08-26T17:27:30Z","snapshot_observed_at":"2026-08-16T17:17:39.640229Z","submitted_at":"2022-03-02T00:56:23Z","title":"Dojo: A Differentiable Physics Engine for Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00806","snapshot_observed_at":"2026-08-11T14:25:18.140983Z","title":"Dojo: A differentiable physics engine for robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.140983Z"},"links":{"cited_paper":"/paper/2203.00806","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:f317c8dbffb6d1c879a33ac476a9ac69b22c051e4b8474988d8f7876ca255ccf","observation_id":"28971864-133c-45bb-a2b5-a4c13ce62cbd","resolution":{"observed_at":"2026-08-11T14:25:18.140983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.320287Z","title":"Path integrals and symmetry breaking for optimal control theory","venue":null,"work_id":"abb3cecd-e32d-4ac6-9bca-1fe81a714e79","year":2005},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.146661Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:ede86646726a23320d845c00545b82ceae806acd9de5afb01a2038b1e2765210","observation_id":"264b630d-494c-4f26-813e-0836c279dddc","resolution":{"observed_at":"2026-08-11T14:25:19.332846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.302449Z","title":"Planning with spatial-temporal abstraction from point clouds for deformable object manipulation","venue":null,"work_id":"92622f56-7a5a-47fb-9c28-4d5e44cced1b","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.153676Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:dc09da17c629171a1013ab70bddef9d2c9e1d0649e14764fa9064ffb13236504","observation_id":"302b6345-ee9e-47c0-9f5a-60077200ad9f","resolution":{"observed_at":"2026-08-11T14:25:19.309051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01315","last_updated":"2024-10-29T17:44:21Z","snapshot_observed_at":"2026-08-17T12:58:38.393092Z","submitted_at":"2023-04-03T19:32:24Z","title":"Empirical Design in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01315","snapshot_observed_at":"2026-08-11T14:25:18.175661Z","title":"Empirical design in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.175661Z"},"links":{"cited_paper":"/paper/2304.01315","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:31a9cad2f3e918d00e1d5d0888f8512ec14e8001d2ef6bd2bf53fbfcafa20c6d","observation_id":"2d62166a-a1f3-403c-a653-f6e671ba0197","resolution":{"observed_at":"2026-08-11T14:25:18.175661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.277775Z","title":"Diffmimic: Efficient motion mimicking with differentiable physics","venue":null,"work_id":"2a3b51f5-f213-472a-9ddd-69b862e10f92","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.183285Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:f0d3be8c3d4ae86af7bf77d94448dbed7ace085b6ead015ecd09a31b184a0eb5","observation_id":"2cfd67f5-9273-43b1-b5b2-fdb0940599e8","resolution":{"observed_at":"2026-08-11T14:25:19.286345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-11T14:25:18.204109Z","title":"Gradient estimation using stochastic computation graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.204109Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:3d904e76a587723431a0bed5e8f88b54953a1c7ef20a7387222ac0148f18ec35","observation_id":"7d48e508-54e3-4987-9f99-ea6190c75cae","resolution":{"observed_at":"2026-08-11T14:25:18.204109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02887","last_updated":"2025-08-27T13:49:35Z","snapshot_observed_at":"2026-08-19T21:26:15.655369Z","submitted_at":"2024-04-03T17:42:22Z","title":"Learning Deployable Locomotion Control via Differentiable Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02887","snapshot_observed_at":"2026-08-11T14:25:18.214365Z","title":"Learning quadrupedal locomotion via differentiable simulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.214365Z"},"links":{"cited_paper":"/paper/2404.02887","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:a988edd905f501fcfd2829018be26544486279229421a18405969c08e7a6e4f3","observation_id":"bc3d8159-d346-4001-b0d8-635058cbca9a","resolution":{"observed_at":"2026-08-11T14:25:18.214365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.248583Z","title":"Issues in using function approximation for reinforcement learning","venue":null,"work_id":"42392e69-71f4-4ddc-a500-e289e6197735","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.221798Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:e2a2f8a1a21159f6591643ae75a3dd1569a73b0262e70df24c5944bd89ebffcd","observation_id":"8c6e3295-80f7-4ebe-a84d-3c041583ffde","resolution":{"observed_at":"2026-08-11T14:25:19.256385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12434","last_updated":"2022-01-28T21:43:21Z","snapshot_observed_at":"2026-08-16T17:25:06.431472Z","submitted_at":"2022-01-28T21:43:21Z","title":"Do You Need the Entropy Reward (in Practice)?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12434","snapshot_observed_at":"2026-08-11T14:25:18.230974Z","title":"Do you need the entropy reward (in practice)? arXiv preprint arXiv:2201.12434,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.230974Z"},"links":{"cited_paper":"/paper/2201.12434","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:cd7ae24436b741a5db93325c1084cc5fe84791e6adbf0a4722ee61ebad83916d","observation_id":"7d2fa325-137c-4857-baab-9ce6c67ad259","resolution":{"observed_at":"2026-08-11T14:25:18.230974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10648","last_updated":"2024-07-16T03:41:08Z","snapshot_observed_at":"2026-08-16T13:34:11.719475Z","submitted_at":"2024-07-15T12:08:53Z","title":"Back to Newton's Laws: Learning Vision-based Agile Flight via Differentiable Physics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10648","snapshot_observed_at":"2026-08-11T14:25:18.240219Z","title":"Back to newton’s laws: Learning vision-based agile flight via differentiable physics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.240219Z"},"links":{"cited_paper":"/paper/2407.10648","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:fa2c58efb8c730a4dd3a722e0caf9b5a9ec431f124abf40f2cdf4f1e5dbb3408","observation_id":"951ab7bd-f575-4b3e-85f4-d69788a0d94b","resolution":{"observed_at":"2026-08-11T14:25:18.240219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.207789Z","title":"Also using implicit differentiation, Qiao et al","venue":null,"work_id":"b1572cac-bffe-4bdb-a3b0-96a34c3391e3","year":2020},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.257733Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:b2ece8c097d428305a6309a83dbd7b29b24e9a2e5fdcf7db5f2c9484b654c4bc","observation_id":"127e30f8-775d-4bfa-8afc-9edcfbf2e2a9","resolution":{"observed_at":"2026-08-11T14:25:19.213655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.182523Z","title":null,"venue":null,"work_id":"b78487b8-eb85-4662-b58a-8c1685646034","year":2013},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.264993Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:c0ef722c900089559c1b380c9b234ef6222e84d9bcca2504c487417853646a5d","observation_id":"153a5a6f-abe2-44bc-9edc-24b09688c396","resolution":{"observed_at":"2026-08-11T14:25:19.191840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.160371Z","title":"π[·] J(π) zt+H zt+H zt+1 zt+1 μt μt+H μt+1 σt+H σt+1 (V) (π) (π) (π) zt st at Actor MLP Actor Encoder Diff","venue":null,"work_id":"f27db6be-79ab-44dc-8e72-376e30fe2d11","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.275747Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:118548a5f79db8f5823973041c1e1c753ce96495c7ffe1b81bd1f8e6b380a98a","observation_id":"a74e3df9-0876-4ec1-8a63-7d9fc1156d2a","resolution":{"observed_at":"2026-08-11T14:25:19.167068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.141901Z","title":"We leave combining differentiable rendering (of RGB or depth image observations) with differentiable simulation, like in (Murthy et al., 2021), to future work","venue":null,"work_id":"caf6309c-63b0-45b4-aa6a-3662bd01ac62","year":2021},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.284274Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:564db1f32ff19821dab52ad935d4deb560849f66504bf4253184dbe795110d3c","observation_id":"af767c56-a068-4ac3-92c9-bd3bcf68ef78","resolution":{"observed_at":"2026-08-11T14:25:19.149850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.052321Z","title":"In comparison, reverse-mode AD has time complexity O(M · L), and also benefits from GPU-acceleration","venue":null,"work_id":"0a8706e5-85ac-4c46-9751-119492d6ded1","year":2021},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.317911Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:92ce406aeef9c9ed58b8e05b1c23a51e91a268f3d8d6eadf1107e5e2e32ea5a6","observation_id":"6e55127b-4105-4733-9e4b-3ef72c23c688","resolution":{"observed_at":"2026-08-11T14:25:19.059741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.003290Z","title":null,"venue":null,"work_id":"e6fdfeb4-b2e9-4d14-9827-2c8ebc17e07b","year":2023},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.330699Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:f0b249879578e36338cf175f564ef689ebb79d6cbbbaeb938d0ae8309f508b87","observation_id":"5095f754-cc73-47a0-8c24-8b94b695fbf3","resolution":{"observed_at":"2026-08-11T14:25:19.010612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.953014Z","title":"Based on AllegroHand from (Makoviychuk et al., 2021)","venue":null,"work_id":"10be99c8-d469-4272-901c-c978696c0563","year":2021},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.352996Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:cefc5bba858ffc534402954110dbd533f4c64b136610374849afcd1e3838a6ce","observation_id":"fe1795f4-95c2-4318-a270-af7b127cd438","resolution":{"observed_at":"2026-08-11T14:25:18.966882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.854216Z","title":null,"venue":null,"work_id":"229437f5-bf33-46b0-a2d0-6a77134a63f1","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.377948Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:9987a9a8c6f3c5993aa285a7ce19360e69ce943c1d69a8a236f303b55184b40d","observation_id":"411fd8d7-02b4-4982-8cc0-faa5d06b39b4","resolution":{"observed_at":"2026-08-11T14:25:18.860908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.916350Z","title":"Based on RollingPin from (Huang et al., 2020)","venue":null,"work_id":"6d783514-3c13-4b7b-89e0-f75b7a363167","year":2020},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.360530Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:117596af33b7f7448f4d99d61375f0c9ee84dbc7d0d6c4c7e0fb306ec0dbd9e4","observation_id":"2c3edd44-66ba-4fda-bdf0-f199542e77b4","resolution":{"observed_at":"2026-08-11T14:25:18.926240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.077891Z","title":"All algorithms use the same actor and critic network architecture","venue":null,"work_id":"e5464dba-208d-44dc-9859-917ac92bc2ad","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.306073Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:1894f48a235a8a9e079edcb84b0c50952ff8a00d2375222512d301f3f5f9f174","observation_id":"e5f985f1-0f44-4c6c-866c-77c900e717fe","resolution":{"observed_at":"2026-08-11T14:25:19.084085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.871084Z","title":"Based on Flip from (Li et al., 2023a)","venue":null,"work_id":"99c8ebce-577d-466d-ab75-efc35a2f5e11","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.372313Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:d9aaa0338a0ad6c4c0c17e9e4514e1b49623e062f87ccde1457ed5a9643b5bcd","observation_id":"5a257b74-960a-4cf5-9f25-a5aa275ccd7b","resolution":{"observed_at":"2026-08-11T14:25:18.877566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.094023Z","title":"All algorithms use the same actor and critic network architecture","venue":null,"work_id":"d96f5910-01d2-46a2-ba4b-e05818e45ed3","year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.298268Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:9e33b0bb4a5894cff317f4476c51d3a9d7ab1d5ef4274707542079c909072956","observation_id":"786e052e-d36a-4945-b434-f1a7f32f84bf","resolution":{"observed_at":"2026-08-11T14:25:19.099814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:18.898511Z","title":"Inspired by (Murthy et al., 2021; Hu et al., 2020)","venue":null,"work_id":"f46d9190-ee7f-4939-bac6-060fdbd73028","year":2021},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.366344Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:6788ab0db26d1d3c6cb68e7a0ba13fd43006e2334f29304df565193910763498","observation_id":"b177be36-fbb5-41b3-809f-7e8229d41c3f","resolution":{"observed_at":"2026-08-11T14:25:18.904096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.229448Z","title":"We review prior works on non-parallel differentiable simulators for robotics and control problems","venue":null,"work_id":"94257614-375e-4e77-81f2-a0b688fe2c65","year":2019},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.249083Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:ae507308b6dae6d76e1b2b173ba33c902d4cc28e96d5a5157de7e728f1c29823","observation_id":"00de969e-614a-418a-856a-243a103cb83b","resolution":{"observed_at":"2026-08-11T14:25:19.236317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05791","last_updated":"2021-09-09T23:49:14Z","snapshot_observed_at":"2026-08-16T18:46:19.925148Z","submitted_at":"2021-02-11T01:06:54Z","title":"Differentiable Implicit Soft-Body Physics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05791","snapshot_observed_at":"2026-08-11T14:25:18.191878Z","title":"Differentiable implicit soft-body physics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.191878Z"},"links":{"cited_paper":"/paper/2102.05791","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:f06373bb53340a253ef16b9e1f993281e226339ec3d6554447efb52742173c0e","observation_id":"e020e6fe-8290-414f-9db3-e592d4e3d8a6","resolution":{"observed_at":"2026-08-11T14:25:18.191878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-11T14:25:18.120507Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.120507Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:06967fe572721d0ab80a401ab5204dd0025323f699b4ddf605768e6a55c36fca","observation_id":"1f87b3bd-a73b-4c89-a02d-56d7803de230","resolution":{"observed_at":"2026-08-11T14:25:18.120507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:25:19.375661Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"897f6ac3-ec2f-4a50-93f8-1906c97cab8e","year":2025},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.098857Z"},"links":{"citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:a08cb29af1f946e7bc0104022607127113879bebd9facd40dbbb983b721a0b08","observation_id":"ffd102da-3bef-4727-be3f-12eb11cdbbf4","resolution":{"observed_at":"2026-08-11T14:25:19.382852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-11T14:25:18.087081Z","title":"Solving rubik’s cube with a robot hand","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.087081Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:104da2fa50bc4cb2bfa50e8737a6a144f177f5db1ca8fc3fccb5a5e8c8ade793","observation_id":"6428e1f0-4e4a-4f3f-a0c9-867b07190c09","resolution":{"observed_at":"2026-08-11T14:25:18.087081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04296","last_updated":"2015-07-16T09:27:06Z","snapshot_observed_at":"2026-08-14T22:40:18.721525Z","submitted_at":"2015-07-15T16:56:56Z","title":"Massively Parallel Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04296","snapshot_observed_at":"2026-08-11T14:25:18.169445Z","title":"Massively parallel methods for deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.169445Z"},"links":{"cited_paper":"/paper/1507.04296","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:ef0b16834d3f20a1810ab0b5e68cb6b560e7033b654b509248c8e58e06c3f45b","observation_id":"9e5d1978-2588-45de-a979-3fce921f4e09","resolution":{"observed_at":"2026-08-11T14:25:18.169445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00101","last_updated":"2018-02-28T21:43:37Z","snapshot_observed_at":"2026-08-16T03:18:43.932234Z","submitted_at":"2018-02-28T21:43:37Z","title":"Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00101","snapshot_observed_at":"2026-08-11T14:25:18.104126Z","title":"Model- based value estimation for efficient model-free reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.104126Z"},"links":{"cited_paper":"/paper/1803.00101","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:f1095116aa38fd6cd1aa4f6ac727a033b118d81148b32b4f46c8c7a50bfaaffe","observation_id":"f675e79f-52ef-4447-adeb-b288ebc72570","resolution":{"observed_at":"2026-08-11T14:25:18.104126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T14:25:18.093289Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.093289Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:176e47cad24aceb4ccfd9774315fd0276a4161c8499f3c018a94976aa7f11c07","observation_id":"41930944-0b66-4dbb-820f-caaede70a043","resolution":{"observed_at":"2026-08-11T14:25:18.093289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T14:25:18.162971Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:18.162971Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.12089"},"observation_digest":"sha256:2d0d735112e4dc4b3f898bd69afad4e9ca4a349c7082bc4f971dcb34a82f0e5c","observation_id":"4baeafc8-f967-42ca-95cb-4912ec108a71","resolution":{"observed_at":"2026-08-11T14:25:18.162971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T12:28:31.733492Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 4 inbound Pith citation observations for arXiv:2412.12089."}