{"as_of":"2026-08-10T01:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c1a03453825990651c34692d450d046ef8d3f5bd530fbdeafd96f749785b7f0","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:38:30.745532Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:27:30.170831Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:56:27.801679Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03550","snapshot_observed_at":"2026-08-07T04:27:30.170831Z","title":"Improving td-mpc through policy constraint,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-09T00:05:01.559769Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.170831Z"},"links":{"cited_paper":"/paper/2502.03550","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:bab49e31e56fa829c9bde1ec9997b791683d86043e540fa9ce061eacf437dbfb","observation_id":"a772cadb-ca4b-44c8-844c-52e155ff9de9","resolution":{"observed_at":"2026-08-07T04:27:30.170831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"cited_work":{"arxiv_id":"2502.03550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03550","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Td-m(pc) 2: Improving temporal difference mpc through policy constraint","venue":null,"work_id":"74bfca82-ab5b-4fdb-be0f-56a173c808c4","year":2025},"citing_paper":{"arxiv_id":"2604.27450","last_updated":"2026-04-30T05:44:46Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T05:44:46Z","title":"RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T08:43:35.563513Z"},"links":{"cited_paper":"/paper/2502.03550","citing_paper":"/paper/2604.27450"},"observation_digest":"sha256:af701d7691b32af21f99253d8e81683e3ea09d673a1130165e78f933d446fa0c","observation_id":"75bf9623-f153-4404-a424-e19b8526d9cf","resolution":{"observed_at":"2026-05-12T09:56:27.805022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"cited_work":{"arxiv_id":"2502.03550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03550","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Td-m(pc) 2: Improving temporal difference mpc through policy constraint","venue":null,"work_id":"74bfca82-ab5b-4fdb-be0f-56a173c808c4","year":2025},"citing_paper":{"arxiv_id":"2605.04568","last_updated":"2026-08-06T08:09:10Z","snapshot_observed_at":"2026-08-09T23:09:42.648225Z","submitted_at":"2026-05-06T07:13:11Z","title":"Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T16:31:35.396809Z"},"links":{"cited_paper":"/paper/2502.03550","citing_paper":"/paper/2605.04568"},"observation_digest":"sha256:b2632099f9e3e12cf12200f3968589bc7fd7794f3bde7ab48d214d804f8436c5","observation_id":"7c62a9e8-584d-419c-b612-6138dcb44332","resolution":{"observed_at":"2026-05-11T18:11:05.433394Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03550/citation-record","integrity":"/paper/2502.03550/integrity","json":"/paper/2502.03550/citation-record.json","paper":"/paper/2502.03550"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-01T17:10:08.501525Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-09T04:38:30.124877Z","title":"Argenson and G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.124877Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:e67cac6533832c2247ea8308e6d8292dc964e140084308405e46deb95e11bd3f","observation_id":"f56e1c6f-7fa0-45ef-98e2-c52492be8718","resolution":{"observed_at":"2026-08-09T04:38:30.124877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.991278Z","title":"Bertsekas","venue":null,"work_id":"1f847e81-100e-4f51-a4ae-ccac898e68f4","year":1996},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.192382Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:aed5375c818872f57846e6b274589598ea4132539db13e2ca0ff29d95482807c","observation_id":"c2bbd487-d4d9-40bd-8fdc-7979a37f7ef1","resolution":{"observed_at":"2026-08-09T04:38:31.996494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.975745Z","title":"Bhardwaj, A","venue":null,"work_id":"90e88f5f-55aa-4220-bbdf-35b7ac72a2a4","year":2020},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.197110Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:803d86118cfead0392a83231d9bf9d4bb7671f6628296785170a5297de2a955f","observation_id":"519b3369-66e9-4e7d-bf7e-dffe0a053f9c","resolution":{"observed_at":"2026-08-09T04:38:31.980648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.959784Z","title":null,"venue":null,"work_id":"0e0283b3-a07a-4364-8758-853f1f1c7c81","year":2022},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.202166Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:ad61490b3a1717a8983a0922de1f5bd8a14c33d4e18e7bff553d0259569fe166","observation_id":"08590fe3-6236-479f-a724-0f7540a02bd6","resolution":{"observed_at":"2026-08-09T04:38:31.964782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:30.207033Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.207033Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:f9318c58336b01dcbf9e342e21c634216f2548de721d68d2aa9423a07a73c892","observation_id":"cabca893-2be3-4a28-9cfc-4f077aa2c774","resolution":{"observed_at":"2026-08-09T04:38:30.207033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.863671Z","title":"Fujimoto and S","venue":null,"work_id":"ef4d139f-785e-43ff-9f75-f8f5e6aedeae","year":2021},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.211877Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:67f6dc2c7354e0d913b0d76476c0f11b2a909f0a7a4b23a4cef5f2cba6df6edf","observation_id":"5a428069-57d7-4dc9-b4a3-e2abcd1a6b02","resolution":{"observed_at":"2026-08-09T04:38:31.919520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.789413Z","title":"Fujimoto, H","venue":null,"work_id":"bc025123-ba5c-4062-9997-93759e39ddbf","year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.218712Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:86224fec1f710dd42fd8e2c0f014ffa72b8ac789e6fab7da4480f077c0835929","observation_id":"7442f3a2-d4a2-4579-9e17-3af9a8ab19eb","resolution":{"observed_at":"2026-08-09T04:38:31.829642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.719272Z","title":"Fujimoto, D","venue":null,"work_id":"3fb49b51-2472-4e71-a24e-11c22d84e1e5","year":2019},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.223435Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:6b9deb4288094b7e237744821d59e743231c5ca454d044e0f0519a3c4923f58c","observation_id":"8feb9364-cea6-4e24-bf8e-c535ff65f48e","resolution":{"observed_at":"2026-08-09T04:38:31.747103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-09T00:04:34.454787Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-09T04:38:30.228255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.228255Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:eb29282dc002e20c1c5e41cce4b278ebb28eee7530bdd520eb342dcc65d2a464","observation_id":"8b590690-0025-41e2-9905-07b1a5960926","resolution":{"observed_at":"2026-08-09T04:38:30.228255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.665998Z","title":"Haarnoja, A","venue":null,"work_id":"1865050a-3558-48c2-b80c-18c54bf92d95","year":null},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.232877Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:1ab32dcdb2805a983073be0990368eb7d4c683e9e28408c9113cada454e3472d","observation_id":"e5977cab-fc46-48e4-b042-c3811fc215c3","resolution":{"observed_at":"2026-08-09T04:38:31.675738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:30.237424Z","title":"Hafner, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.237424Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:2e51202688cfa216c93eb61c9cc4d94397e4e25d8a7e2d2c026caa5f355074ae","observation_id":"70b6a54d-f06b-48c5-ad77-27857d432087","resolution":{"observed_at":"2026-08-09T04:38:30.237424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-09T04:38:30.242136Z","title":"Hafner, T","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.242136Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:5165345140fffbeded57fd733aacf691d8e94e23eee21c268c4cfbf18adedb4c","observation_id":"a660f189-2834-4629-9f96-021408a568d7","resolution":{"observed_at":"2026-08-09T04:38:30.242136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-09T04:38:30.257078Z","title":"Hafner, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.257078Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:a2659f7b2f96c6d98de0b0250e53900ddd42c1294d90be23a3d7ae4ad61b693d","observation_id":"401fa314-6b9f-47b7-a504-5b3bfd1767f3","resolution":{"observed_at":"2026-08-09T04:38:30.257078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-09T04:38:30.266687Z","title":"Hansen, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.266687Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:86c00250180d5fee60678b26fd3c71695ac0c1be345231337204881f59e08a72","observation_id":"f4b7eb98-7dfd-4f39-9e84-d717639c59f9","resolution":{"observed_at":"2026-08-09T04:38:30.266687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-09T04:38:30.271605Z","title":"Hansen, X","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.271605Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:f44e0eca04da8c52c1e813b529f8682647a5512e2da2c8ef48e1a11c998d1216","observation_id":"4249080f-d4b3-4d86-a741-110d2eac392b","resolution":{"observed_at":"2026-08-09T04:38:30.271605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-09T04:38:30.276596Z","title":"Hansen-Estruch, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.276596Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:c6a5fe40642bbdbe669707c387abc8ba695e82cfe334760980caaf7bb9ec2fab","observation_id":"eeaeff53-9369-48a2-8fdb-d34285396c27","resolution":{"observed_at":"2026-08-09T04:38:30.276596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.637706Z","title":"Janner, J","venue":null,"work_id":"7ad86500-ca32-43e5-bba1-676880183dfc","year":2019},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.281062Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:669781b3c87b8e22fdf49ab6e8e0d2d019cfcc14901c8737204b082a2d4c883b","observation_id":"ae0332d3-7a15-42c5-a263-eb211c34bf9c","resolution":{"observed_at":"2026-08-09T04:38:31.642661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.621232Z","title":"Kabzan, L","venue":null,"work_id":"871531f2-138e-41c3-bc56-77827445f3c7","year":2019},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.285679Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:d1b212ce88082a1cc5b62c8aa67489d26ec64872b4535b265de7cf03e4972d7b","observation_id":"6141572d-b3b7-4136-bcbb-60c913ca303b","resolution":{"observed_at":"2026-08-09T04:38:31.626186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.604336Z","title":"Katsigiannis and N","venue":null,"work_id":"743cbabd-7ee9-436b-a311-77aee00dad29","year":2017},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.289823Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:235db4f04b93cf71d73213e78ca7502cd831228c13aa49f740f3471fa8e7b080","observation_id":"42cae131-7b0f-4643-bdf9-76a84831b285","resolution":{"observed_at":"2026-08-09T04:38:31.609507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-09T04:38:30.294338Z","title":"Kostrikov, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.294338Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:d7260661256c38d04e63716279cf9ed30798269e450c39970e565a0e3fb0324d","observation_id":"9c18f673-7e58-471c-aa6e-cb5990781dc0","resolution":{"observed_at":"2026-08-09T04:38:30.294338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.589434Z","title":"Kumar, J","venue":null,"work_id":"61d52b04-d028-4b89-90b0-fcde7295ef3d","year":2019},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.298917Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:2868bbef546123f4b89edbaa5aea3366fda70b63e6004c426744b5028e0c91f8","observation_id":"7a85f7ab-7872-4eb4-9af3-31ab4ef8bcb1","resolution":{"observed_at":"2026-08-09T04:38:31.594121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.574389Z","title":"Kumar, A","venue":null,"work_id":"de102758-6fe9-485f-abfe-ce28a0b8b546","year":2020},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.303175Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:f75635854794bd477d302bda602507482a2600780d8dc3306f3f1b3fa1c93af8","observation_id":"83656bc0-ea89-49bf-9cc9-47ae1768b611","resolution":{"observed_at":"2026-08-09T04:38:31.579052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-09T04:38:30.339026Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.339026Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:55163aad084945d42a08ea956b6ad05328b3a39856ae097b17bab12ade6436ca","observation_id":"2e7546d1-e634-4b71-b34c-7210e38c3061","resolution":{"observed_at":"2026-08-09T04:38:30.339026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:30.371033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.371033Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:f04bc78059b505f7e6b64ad6e93996102f9517fe1093932de317a572850c233b","observation_id":"029326ba-1ce2-4930-958f-0a7ecdd9392c","resolution":{"observed_at":"2026-08-09T04:38:30.371033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.557735Z","title":"Littman and A","venue":null,"work_id":"4a70c3f7-1a9c-48f6-be57-23071b1010a2","year":1996},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.410665Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:6a6e698aeb54317bba323cabc001dc04582f9222f87cb8724a6bc5a75548e128","observation_id":"e0318fbd-c343-4565-ab6c-4468e4f59fd5","resolution":{"observed_at":"2026-08-09T04:38:31.563079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01848","last_updated":"2019-01-28T16:39:23Z","snapshot_observed_at":"2026-07-06T07:12:44.495733Z","submitted_at":"2018-11-05T17:09:18Z","title":"Plan Online, Learn Offline: Efficient Learning and Exploration via Model-Based Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01848","snapshot_observed_at":"2026-08-09T04:38:30.455729Z","title":"Lowrey, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.455729Z"},"links":{"cited_paper":"/paper/1811.01848","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:9dcf652d2a68c190d61a06fa5516fad3231064e0a1a4fb703583bcdd970626a1","observation_id":"7348b843-5152-447b-b0ab-b73dd3d03181","resolution":{"observed_at":"2026-08-09T04:38:30.455729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.541614Z","title":null,"venue":null,"work_id":"d7032a7c-69f2-4e5d-b538-4b90861a55c8","year":2023},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.487926Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:72f9dd8445a0d4ae3dcc98bb3f1af68f839b8092a6471569d9d1df2b54ab8d89","observation_id":"1e4ef373-e834-469e-920c-4bac2418e548","resolution":{"observed_at":"2026-08-09T04:38:31.546528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.526045Z","title":null,"venue":null,"work_id":"d4ecffa0-652e-4283-aa6a-1fea3dc5c64a","year":2007},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.524226Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:c3563d1a47a3d4b4141f94dafd183f48b9d457531f1b88e4cf6e7ebe44f0f6d8","observation_id":"5f696695-2beb-46e4-b953-857243b74732","resolution":{"observed_at":"2026-08-09T04:38:31.530900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-09T04:38:30.572672Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.572672Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:dc7a81b091bafc7fa4efcfc6c65d9986f6f859f9b38a7f54345506ceec41bf15","observation_id":"f4b860dc-19a2-4a85-a1c0-4331ef5d6a08","resolution":{"observed_at":"2026-08-09T04:38:30.572672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.510447Z","title":"Nakamoto, S","venue":null,"work_id":"87652518-3c9a-4804-9f02-e5ef0639fecf","year":2024},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.609097Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:69e2c1146fd0c45d53552d9496769fbd3c6f0e3756babf93042af5a6a952d5e9","observation_id":"79e80661-4606-431d-bf29-13365e22ffd8","resolution":{"observed_at":"2026-08-09T04:38:31.515069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-09T04:38:30.689021Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.689021Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:eb2afa7ef5129452e969897c856eaca49f4f43d2093d48d24a32ad7af653dd20","observation_id":"d7bf83f9-7ea1-4056-8267-c873f50e8fe9","resolution":{"observed_at":"2026-08-09T04:38:30.689021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-09T04:38:30.694082Z","title":"Schulman","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.694082Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:f7262c1b3d1a86c478e1c9f4bc5ec67d3be874599ccb5f766dfdd4de348080bf","observation_id":"630c9d3d-4412-45d3-b40b-f0db30e070d4","resolution":{"observed_at":"2026-08-09T04:38:30.694082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-09T04:38:30.698954Z","title":"Sferrazza, D.-M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.698954Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:9e082d296cf40d7c9df2f35f9c59a5c2cafa88309c4c14364592bc205b7fd4ab","observation_id":"1294ccb0-cd74-46f5-b3e4-88d81c668ee6","resolution":{"observed_at":"2026-08-09T04:38:30.698954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.417274Z","title":"Sikchi, W","venue":null,"work_id":"74ad1770-f0f6-4384-a106-43dc056122af","year":2022},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.703425Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:faef75b305f44883a18ef8b798f49726faa0c8508684644d2c628824aa82a3e1","observation_id":"cce74b20-cde2-4ce9-946f-f98bd742c5a1","resolution":{"observed_at":"2026-08-09T04:38:31.472133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.294339Z","title":null,"venue":null,"work_id":"441e9293-8703-4bed-9de5-90c6723ddda8","year":1994},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.707899Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:ca3d846660fd56a6ccec8976c6747ae830b0abf6781858927700608b5cfc0be4","observation_id":"95bbe34e-3893-4893-a074-af28b11983b2","resolution":{"observed_at":"2026-08-09T04:38:31.321794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:30.711895Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.711895Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:a9ef8f34b41cbc12ea688868208e5fd8582c6d05887ed653c83e363a4deb8dd7","observation_id":"e714c118-1a4f-4184-81fb-10adb79753f1","resolution":{"observed_at":"2026-08-09T04:38:30.711895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:30.716371Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.716371Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:1be57406e6429da168dc7f99f9826209540bea3417cb0adc6f6fca69a3942728","observation_id":"524f49e3-1015-4ff9-8ba5-bf0351f5b9fb","resolution":{"observed_at":"2026-08-09T04:38:30.716371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T04:38:30.724743Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.724743Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:785fa5c9acc21275455b94e98711e2d395db08f6808d3fff3b9f3c8406eceb67","observation_id":"03b7e3bf-b9ad-4a06-9d3d-d41cd7ab7fc9","resolution":{"observed_at":"2026-08-09T04:38:30.724743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.261447Z","title":"Thrun and A","venue":null,"work_id":"932d58e7-ec46-4919-8257-55ed923a2d3f","year":1993},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.730792Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:e721dd3b38d257d25a1f994464919ed0ca0c5480cb0e5443624f4ee2f538daa8","observation_id":"8823a377-3131-4459-bc00-2a4113ebc097","resolution":{"observed_at":"2026-08-09T04:38:31.265681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:38:31.245353Z","title":"Williams, N","venue":null,"work_id":"120810b4-5f0f-4135-b2d7-aca37c1f9f42","year":2017},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.734739Z"},"links":{"citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:a8bf6ca5ed1b858459f805f1e0f69b2ec92592d51a406a4f42fce32bdca34cab","observation_id":"aff67faf-75cd-4427-8aa2-a7851e2150eb","resolution":{"observed_at":"2026-08-09T04:38:31.250709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05364","last_updated":"2025-05-22T22:22:48Z","snapshot_observed_at":"2026-08-07T23:22:33.078945Z","submitted_at":"2024-10-07T17:56:47Z","title":"Diffusion Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05364","snapshot_observed_at":"2026-08-09T04:38:30.745532Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.745532Z"},"links":{"cited_paper":"/paper/2410.05364","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:d5eb5b4a480877b0dea2c807b37fd41bfab8013e14dedb50f9cf627181081c6b","observation_id":"5e5b0fcc-f58c-4872-b15f-75026891178c","resolution":{"observed_at":"2026-08-09T04:38:30.745532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:45:49.361560Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2502.03550."}