{"as_of":"2026-08-09T20:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16e2e9fa31a93605f4c42ed5da3da41861a0c119d9eb2572920e8b5accc63dcf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:18:44.957482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:00:06.256105Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T16:06:09.448517Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2411.04983"},"observation_digest":"sha256:e250d93254f7230d2ab32c366072e2e2fe1c6234952e555640f5a63ad6223788","observation_id":"b86049ce-e128-480b-999e-31cd066c7fcb","resolution":{"observed_at":"2026-05-17T16:06:09.742215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-09T19:18:44.957482Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00379","last_updated":"2025-06-12T16:28:52Z","snapshot_observed_at":"2026-08-09T19:10:26.702222Z","submitted_at":"2025-02-01T09:35:51Z","title":"Latent Action Learning Requires Supervision in the Presence of Distractors","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T19:18:44.957482Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2502.00379"},"observation_digest":"sha256:adc54321f5725f556b90c81130516951535a2020259a75254ba99cca7aa8ad3b","observation_id":"39a98327-8d10-468b-8af8-4b2691f3311a","resolution":{"observed_at":"2026-08-09T19:18:44.957482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-09T04:38:30.271605Z","title":"Hansen, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T04:29:54.315078Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.271605Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:1066c8837c179959d66e426d8d35dba0c2d909c7e00118c766e0cd4160201aec","observation_id":"4249080f-d4b3-4d86-a741-110d2eac392b","resolution":{"observed_at":"2026-08-09T04:38:30.271605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-07T11:46:58.397406Z","title":"Hansen, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01600","last_updated":"2025-06-02T12:35:14Z","snapshot_observed_at":"2026-08-07T11:35:34.588714Z","submitted_at":"2025-06-02T12:35:14Z","title":"WoMAP: World Models For Embodied Open-Vocabulary Object Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.397406Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.01600"},"observation_digest":"sha256:3d5f11fd040f8eba5c4d43e3d0e5f6bb2956a4fa9fedef84bffb58c80b8c7cf0","observation_id":"eab4e933-d8a5-4a34-a61d-f518ae8a57d6","resolution":{"observed_at":"2026-08-07T11:46:58.397406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:900d0bd518f51bc5f8424982b94a7199af6491e3f5e0646366ff156003bcf997","observation_id":"a750b801-2ecd-4803-8de8-21424d59e889","resolution":{"observed_at":"2026-05-19T10:52:15.261991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:3e246f5190f3d4b8b1d21580864b96dd9217a48e67b00f4a98e60be01083458a","observation_id":"ae0cd45e-f4f7-48f4-b121-c83b93de9fc5","resolution":{"observed_at":"2026-05-15T14:18:51.670797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:c5c71f06b3933879366e2f11ed1976557cbd4b4513b933788080e6346fa7b017","observation_id":"5754e964-70a6-4abd-a996-3b33939c6594","resolution":{"observed_at":"2026-05-11T00:33:50.866977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2506.10137","last_updated":"2026-04-19T14:49:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T19:32:41Z","title":"Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T09:15:45.511104Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.10137"},"observation_digest":"sha256:c07db63efe54c3dbf658f6fcb455424f156ec3b86f4d836029cbf6c477b06f0e","observation_id":"1a33e769-05e3-4b25-9260-985923d1599b","resolution":{"observed_at":"2026-05-19T09:17:14.161907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-07T00:40:22.074261Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:22.074261Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:877d62a04af71f05d56a87fbc2f3bc07228f77cfdf1ae73d43195c31ce554b87","observation_id":"2499a6b0-ac18-4471-ab79-133415da982d","resolution":{"observed_at":"2026-08-07T00:40:22.074261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-06T23:49:28.994599Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16079","last_updated":"2025-06-19T07:04:24Z","snapshot_observed_at":"2026-08-08T02:39:26.753295Z","submitted_at":"2025-06-19T07:04:24Z","title":"Investigating Lagrangian Neural Networks for Infinite Horizon Planning in Quadrupedal Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:28.994599Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.16079"},"observation_digest":"sha256:20ee135c3f1961c2938503951f2b42c95ea30e27a29eec57649baa5efd23c4b9","observation_id":"ffd82329-753f-467b-93d4-035e47ca5a57","resolution":{"observed_at":"2026-08-06T23:49:28.994599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-06T22:23:48.993986Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-09T10:10:40.982000Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.993986Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:ad624f99809676cb61a098854a02cf7b48c77c35ee7552de51f37aca9d457658","observation_id":"758f57f7-b5a3-47c9-8015-bdaf72ee23d4","resolution":{"observed_at":"2026-08-06T22:23:48.993986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-06T19:12:58.596909Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06326","last_updated":"2025-07-08T18:30:26Z","snapshot_observed_at":"2026-08-08T21:17:27.918822Z","submitted_at":"2025-07-08T18:30:26Z","title":"Sample-Efficient Reinforcement Learning Controller for Deep Brain Stimulation in Parkinson's Disease","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:12:58.596909Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2507.06326"},"observation_digest":"sha256:465e9637aabe1dc518b900d01850df55279deb72b75be187f6535a63b1de8dac","observation_id":"b20647d5-91c5-4072-a4c9-6280a9e409cc","resolution":{"observed_at":"2026-08-06T19:12:58.596909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-05T23:06:33.769454Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05941","last_updated":"2026-07-01T21:54:22Z","snapshot_observed_at":"2026-08-08T16:23:41.867796Z","submitted_at":"2025-08-08T02:07:08Z","title":"Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:06:33.769454Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2508.05941"},"observation_digest":"sha256:89a13fb1243164d3fb2433bfd6575e6bb82e662b5581dc90d7a16f9e077f7623","observation_id":"6539a871-cc50-41c3-9916-4241e83ac012","resolution":{"observed_at":"2026-08-05T23:06:33.769454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-05T16:41:53.486675Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18066","last_updated":"2025-08-25T14:22:40Z","snapshot_observed_at":"2026-08-09T12:55:02.482123Z","submitted_at":"2025-08-25T14:22:40Z","title":"Arnold: a generalist muscle transformer policy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:53.486675Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2508.18066"},"observation_digest":"sha256:fcbae5ad770126136006f075c4ba0f0598538d60d2c93e90847008a24dbb7924","observation_id":"a0943cec-78f7-44e1-958e-ca6abdf9043f","resolution":{"observed_at":"2026-08-05T16:41:53.486675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2509.17387","last_updated":"2025-09-22T06:51:53Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T06:51:53Z","title":"High-Precision and High-Efficiency Trajectory Tracking for Excavators Based on Closed-Loop Dynamics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T15:30:19.253933Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2509.17387"},"observation_digest":"sha256:9b309214c862a4db528f72360d2ef0420a5171190236fecb0bca47ab6ffd48c3","observation_id":"7b387953-eda6-4620-9c97-6611d230f78c","resolution":{"observed_at":"2026-05-18T15:31:33.478521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:91c921e4cd95b6005d6799f9e2f941ce37499694be055d5eafe054232be28fcc","observation_id":"b0bb3a76-b285-49d5-9221-c98dfe250bd5","resolution":{"observed_at":"2026-05-18T14:36:28.673612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2510.03508","last_updated":"2026-05-22T04:10:55Z","snapshot_observed_at":"2026-08-02T14:15:10.091088Z","submitted_at":"2025-10-03T20:47:24Z","title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T07:31:27.330951Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2510.03508"},"observation_digest":"sha256:4d548eb65d859564d2df4c78260b0b31b5758fd057b104d1aabd37623d258ef4","observation_id":"02524fc5-bb06-4565-9c41-dd5ae15b49d1","resolution":{"observed_at":"2026-05-25T07:35:29.447709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:643a9e19d7cf61faf97b69912468f26198125ebee1bae97423f4097a21a99a8b","observation_id":"1e85fd0c-eeb7-4b03-b1b0-084afa60a574","resolution":{"observed_at":"2026-05-16T01:14:10.399192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2511.05963","last_updated":"2026-05-25T15:53:24Z","snapshot_observed_at":"2026-08-08T22:18:33.888125Z","submitted_at":"2025-11-08T10:41:26Z","title":"Next-Latent Prediction Transformers Learn Compact World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T07:21:04.684347Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2511.05963"},"observation_digest":"sha256:a3a93d60c525648984fa800df90c1398c8a7568c51e8c4ae5d6b92510aedf6b6","observation_id":"e07f23f2-a065-4dc2-a677-93eb3386fc5f","resolution":{"observed_at":"2026-05-25T07:25:29.528570Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-03T23:27:55.490000Z","title":"Dan Hendrycks and Kevin Gimpel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05963","last_updated":"2026-05-25T15:53:24Z","snapshot_observed_at":"2026-08-08T22:18:33.888125Z","submitted_at":"2025-11-08T10:41:26Z","title":"Next-Latent Prediction Transformers Learn Compact World Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T23:27:55.490000Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2511.05963"},"observation_digest":"sha256:3684bc34796d886c9bddff2bacfeeec52f3e68de94cdc9d0c7c556fa5f7416ee","observation_id":"5557c7da-06d9-48d5-97af-6e146eac1cb0","resolution":{"observed_at":"2026-08-03T23:27:55.490000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-03T22:45:05.283619Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.09331","last_updated":"2026-07-11T16:56:25Z","snapshot_observed_at":"2026-08-08T04:18:01.543499Z","submitted_at":"2025-11-12T13:46:27Z","title":"CoRL-MPPI: Enhancing MPPI With Learnable Behaviours For Efficient And Provably-Safe Multi-Robot Collision Avoidance","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:45:05.283619Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2511.09331"},"observation_digest":"sha256:28511b016bbbb20dfd11bb10fa29cf369728a720eac3bfcdbc914db8db2514e9","observation_id":"5ebb0c64-7a51-49cc-8dd9-3cc23dc5e40b","resolution":{"observed_at":"2026-08-03T22:45:05.283619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:1aef253e40f9ac5fc6f59a2db9e999eb8ae748607547af376f6d837652613898","observation_id":"bc98658b-637c-4452-9ece-d4ffce8d7d84","resolution":{"observed_at":"2026-05-12T14:50:12.913336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-15T12:09:16.468055Z","title":"Temporal difference learning for model predictive control.arXiv preprint arXiv:2203.04955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09221","last_updated":"2026-05-29T05:28:18Z","snapshot_observed_at":"2026-07-15T12:09:13.856257Z","submitted_at":"2026-03-10T05:42:13Z","title":"Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-15T12:09:16.468055Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2603.09221"},"observation_digest":"sha256:2eb34df1a37a8cbb8cb6c95528c51ecb41f880406539fba0d9ce925b61c31a07","observation_id":"eafb0b50-f16f-42ca-8105-9781c824625a","resolution":{"observed_at":"2026-07-15T12:09:16.468055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2604.27450","last_updated":"2026-04-30T05:44:46Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T05:44:46Z","title":"RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T08:43:35.563513Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2604.27450"},"observation_digest":"sha256:628154f1f44b329c1f385a803b92b03bd4b0819b63afb40ff7fd54b1c3cf655d","observation_id":"e8b490cc-ed7f-414a-ba21-c9bfa54c004e","resolution":{"observed_at":"2026-05-12T09:56:27.799296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.01950","last_updated":"2026-05-03T16:19:45Z","snapshot_observed_at":"2026-07-06T23:15:07.159340Z","submitted_at":"2026-05-03T16:19:45Z","title":"TRAP: Tail-aware Ranking Attack for World-Model Planning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:45.407680Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.01950"},"observation_digest":"sha256:4e45f9288619a73bb0b549b2c3871a6c7e6fa12f4697376043492553fe9d95a8","observation_id":"f352925b-cc14-4e46-81e1-416b17436e9b","resolution":{"observed_at":"2026-05-11T10:56:04.901730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.07079","last_updated":"2026-05-08T00:58:16Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T00:58:16Z","title":"Learning Visual Feature-Based World Models via Residual Latent Action","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T01:37:27.658078Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.07079"},"observation_digest":"sha256:8f76683c24541920e071771fc701f7fed0fc745ab384cdae5cfe730d37621895","observation_id":"4ff10b9a-d7d1-40fe-975d-2e3dd7cc63b3","resolution":{"observed_at":"2026-05-11T01:40:51.947552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.13013","last_updated":"2026-05-13T05:07:32Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T05:07:32Z","title":"JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:37:19.404335Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.13013"},"observation_digest":"sha256:c69649eafa6bd6dc04b0495faeb372f1eed06735f42ad5993d34b3f2a3ed9604","observation_id":"0fb90d78-f436-4320-a716-5141f08363e2","resolution":{"observed_at":"2026-05-14T19:37:51.941434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.14304","last_updated":"2026-05-14T03:12:29Z","snapshot_observed_at":"2026-08-03T04:02:31.058649Z","submitted_at":"2026-05-14T03:12:29Z","title":"Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:03:11.540545Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.14304"},"observation_digest":"sha256:99e182d7c2fd54947ecfe1465a7f9bbef8ec4693e9a1561bea4cf4f712068593","observation_id":"5deb802f-3537-44be-a08e-e9e8d8a2486d","resolution":{"observed_at":"2026-05-15T02:03:28.775037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.16054","last_updated":"2026-05-15T15:21:25Z","snapshot_observed_at":"2026-08-03T10:16:57.496693Z","submitted_at":"2026-05-15T15:21:25Z","title":"Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making","version":1},"reference_index":300,"source":"arxiv_source","source_observed_at":"2026-05-20T20:54:31.025488Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.16054"},"observation_digest":"sha256:839f244b8b510e7d34944d19bf9c9c856e8c40fd1d158bfdf367fb21c9a33022","observation_id":"1aad3508-dc94-454c-9196-d633a5efbdb8","resolution":{"observed_at":"2026-05-20T20:59:02.097841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.21800","last_updated":"2026-05-20T22:58:15Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T22:58:15Z","title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T08:57:19.834179Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.21800"},"observation_digest":"sha256:542d1a7df036dbc7134062d297cc89a632ac00b39783afc9747bfcc01a0868d2","observation_id":"5221a487-d671-40b3-8abe-9c1d1dc5c585","resolution":{"observed_at":"2026-05-22T09:01:20.259352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.26282","last_updated":"2026-05-25T19:06:51Z","snapshot_observed_at":"2026-08-02T12:16:30.744884Z","submitted_at":"2026-05-25T19:06:51Z","title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:46:27.179341Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.26282"},"observation_digest":"sha256:b621a948343d7fadfa0f388364a2af6c4ee74d9c318bb46ab12543ba7881fb01","observation_id":"6467fad2-d804-4929-a4f4-601c7fa178d1","resolution":{"observed_at":"2026-06-29T22:54:01.393138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.26478","last_updated":"2026-05-26T02:35:08Z","snapshot_observed_at":"2026-08-02T15:14:06.593016Z","submitted_at":"2026-05-26T02:35:08Z","title":"Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T17:34:41.053725Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.26478"},"observation_digest":"sha256:4702db59627f2a50f1310b2d35f01e72cc5e873c70df9e95c87fbd35f6a1ac89","observation_id":"3d7662a0-b317-4104-9406-3d811556df83","resolution":{"observed_at":"2026-06-29T18:03:48.589473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.29360","last_updated":"2026-05-28T04:58:15Z","snapshot_observed_at":"2026-08-06T11:23:36.274726Z","submitted_at":"2026-05-28T04:58:15Z","title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T07:46:28.469913Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.29360"},"observation_digest":"sha256:6b9eebf98e0474df734e361aa70aa194ec32d45e8fde4766013289d2b11ca46b","observation_id":"9a77346a-24c1-43bc-920f-d581620dccf6","resolution":{"observed_at":"2026-06-29T07:53:13.836554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2605.30928","last_updated":"2026-05-29T07:18:20Z","snapshot_observed_at":"2026-08-07T22:40:31.179373Z","submitted_at":"2026-05-29T07:18:20Z","title":"Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:29:34.616531Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2605.30928"},"observation_digest":"sha256:c81547733686eb68e4e3beaee12ee2bfdbbb5ef015280712ff9c079a0a3e876a","observation_id":"d0ccad1b-1419-47ed-ab0a-ebab28666818","resolution":{"observed_at":"2026-06-28T22:32:44.205977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:dec6292e49fd2034c4516c07c9827afd01b6ee45b260a00948ca53f623142ebe","observation_id":"a9e4387f-ba8b-4e27-9052-eb84d5f43e5c","resolution":{"observed_at":"2026-07-03T10:48:03.124660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2606.24991","last_updated":"2026-06-23T14:51:59Z","snapshot_observed_at":"2026-08-07T11:52:47.774877Z","submitted_at":"2026-06-23T14:51:59Z","title":"Solving Markov Decision Processes with Future Information via MPC","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-25T22:00:02.577707Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2606.24991"},"observation_digest":"sha256:13e0c4ca4e3f606f69249b3ca3425c7a34357c9d5fc07d7c7eea5f09f254b645","observation_id":"62e5c0bf-1b8e-44de-ad89-bc8f631f0feb","resolution":{"observed_at":"2026-07-04T19:00:06.257841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2607.00917","last_updated":"2026-07-01T13:22:18Z","snapshot_observed_at":"2026-07-07T00:06:35.457630Z","submitted_at":"2026-07-01T13:22:18Z","title":"Valdi: Value Diffusion World Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-02T15:46:50.507626Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.00917"},"observation_digest":"sha256:e57d94d5229516e273c8ce9fa4d99b313d07f085776cf2b668a169a7433a6fda","observation_id":"9dddc824-db97-47c5-8e68-30ebc3cdc0da","resolution":{"observed_at":"2026-07-02T15:47:05.609873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-02T00:24:04.583755Z","title":"Hansen, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15065","last_updated":"2026-08-03T21:25:00Z","snapshot_observed_at":"2026-08-07T23:09:33.185976Z","submitted_at":"2026-07-16T14:37:43Z","title":"DriftWorld: Fast World Modeling through Drifting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:24:04.583755Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.15065"},"observation_digest":"sha256:f9433cd56d682d8dd20288a231d379d808efc9f663af3025ca5d017a33171645","observation_id":"debe30af-548b-4ee4-8683-a8205d23c246","resolution":{"observed_at":"2026-08-02T00:24:04.583755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-01T17:45:21.168260Z","title":"arXiv preprint arXiv:2203.04955 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":254,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:21.168260Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:03faea034f85b9b90a122e243dcb1a4524839881141a64def329a2215566955c","observation_id":"4c724199-6b02-4ee6-a461-50feb15d93dc","resolution":{"observed_at":"2026-08-01T17:45:21.168260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-01T12:24:20.765658Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21644","last_updated":"2026-08-04T03:19:33Z","snapshot_observed_at":"2026-08-07T23:09:35.522190Z","submitted_at":"2026-07-21T20:49:07Z","title":"Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:24:20.765658Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.21644"},"observation_digest":"sha256:32c73574ac0ff8c5a1154e69447ce9ae912fd561b6062641504413b1278e0211","observation_id":"42a18446-7aa8-464e-8d94-6ef3f37aafbe","resolution":{"observed_at":"2026-08-01T12:24:20.765658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-01T06:32:51.940717Z","title":"Anusha Nagabandi, Gregory Kahn, Ronald S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21867","last_updated":"2026-07-23T23:47:03Z","snapshot_observed_at":"2026-08-07T07:42:04.035180Z","submitted_at":"2026-07-23T23:47:03Z","title":"When Is a Learned Command Adapter Worth It? Closed-Loop Identification and Counterfactual Auditing of Frozen Locomotion Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:51.940717Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.21867"},"observation_digest":"sha256:0eaecd611ededc2f00fee616f542bf45064964841cee51d9f3b1f27397be4599","observation_id":"7de8c998-94cb-4d96-98a8-5f39e1582169","resolution":{"observed_at":"2026-08-01T06:32:51.940717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-01T04:59:31.588147Z","title":"Hansen, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27599","last_updated":"2026-07-30T02:41:52Z","snapshot_observed_at":"2026-08-06T16:54:52.053768Z","submitted_at":"2026-07-30T02:41:52Z","title":"World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T04:59:31.588147Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2607.27599"},"observation_digest":"sha256:9bc3d538915efe991e7ec5b28715599b55ec337c8d607a1cb1bd851705db424a","observation_id":"8fd80f4c-4625-4ccb-bb8f-d3e3a4e7c2e8","resolution":{"observed_at":"2026-08-01T04:59:31.588147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-04T19:45:32.767376Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:32.767376Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:8b6934c7fea04c2724c3ab8bf6b7cda20ecd38575cbbe0eb6c8cedabdfc3caa4","observation_id":"3e8be49d-0c0e-4320-9bcf-87242aebceb4","resolution":{"observed_at":"2026-08-04T19:45:32.767376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.04955/citation-record","integrity":"/paper/2203.04955/integrity","json":"/paper/2203.04955/citation-record.json","paper":"/paper/2203.04955"},"outbound":[],"paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2203.04955."}