{"as_of":"2026-08-14T11:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4f1129d65bcd116303972aa529b4015dad3e131f72d9f302a71156eaf49acde","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:20.742361Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01823/citation-record","integrity":"/paper/2507.01823/integrity","json":"/paper/2507.01823/citation-record.json","paper":"/paper/2507.01823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.394489Z","title":"Learning dexterous in-hand manipulation","venue":null,"work_id":"d85002b7-8653-46bb-9fed-e11357563c82","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.390346Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:0ec09ae3682b3741fe1c1c4975a882533c9cb40c543c94e65b2c5fc6a1c4e48e","observation_id":"04e8cbc0-f772-4358-9ce7-06de442aa9d1","resolution":{"observed_at":"2026-08-06T20:47:23.473018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.214208Z","title":"Multitask learning","venue":null,"work_id":"c6ae7966-00ed-462a-b018-be6d2b48bc07","year":1997},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.406344Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:2227e4b09ff65df9569e80d2ea8c52e9ff64b616996e5f7a8755f8278c1454a1","observation_id":"9263eaca-20d5-46ab-8758-8c32302f40e5","resolution":{"observed_at":"2026-08-06T20:47:23.314129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.030768Z","title":"Deep reinforce- ment learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"be2d063f-b8b6-40f3-a069-baaf87d789fc","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.416301Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:3506848e5eb96194f188a35c762f94add33ae3dd8fe48d0211a905906ea389f8","observation_id":"6c0e3251-fa33-452d-9d3b-12d0c98feaee","resolution":{"observed_at":"2026-08-06T20:47:23.112922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.885757Z","title":"Distilling policy distillation","venue":null,"work_id":"6920c071-c588-4303-a584-d070e1538539","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.425545Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:14442efbef5ad01eb13e2847d245fbea480b984306f1a550433f34ea97b65ea9","observation_id":"d1468e31-2710-4527-8c86-414adf765016","resolution":{"observed_at":"2026-08-06T20:47:22.951909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.765581Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":"8f86f32c-7ffe-445e-9e88-e67149f81209","year":2017},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.433050Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:5c73d5b89da93a5e709ce5d0f48145735e36be15fca91faf5e240aa266c7f966","observation_id":"c1a1e3d9-3583-458f-8612-acbcbdb931ac","resolution":{"observed_at":"2026-08-06T20:47:22.809935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.444697Z","title":"Model predictive control: Theory and practice—a survey","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.444697Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:fb63738abe29208799bf47785160046328d82e5b27af71fdbb59a392b3bba592","observation_id":"bcaecc37-eca4-461b-a67f-6cf8a4848649","resolution":{"observed_at":"2026-08-06T20:47:20.444697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02466","last_updated":"2025-02-24T06:56:00Z","snapshot_observed_at":"2026-08-12T23:30:12.625537Z","submitted_at":"2024-07-02T17:47:03Z","title":"PWM: Policy Learning with Multi-Task World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02466","snapshot_observed_at":"2026-08-06T20:47:20.450908Z","title":"Pwm: Policy learning with large world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.450908Z"},"links":{"cited_paper":"/paper/2407.02466","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:b1b0c253514c14b8b57b51ec5d513f663a647d33c25a2f7ac468382b0cbea1f7","observation_id":"21171bc0-8935-4a9a-b243-2dcc2542cc23","resolution":{"observed_at":"2026-08-06T20:47:20.450908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13630","last_updated":"2021-06-21T21:01:12Z","snapshot_observed_at":"2026-08-13T19:52:23.610086Z","submitted_at":"2021-03-25T06:57:11Z","title":"A Survey of Quantization Methods for Efficient Neural Network Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13630","snapshot_observed_at":"2026-08-06T20:47:20.455721Z","title":"A survey of quantization methods for efficient neural network inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.455721Z"},"links":{"cited_paper":"/paper/2103.13630","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:22180bfcb134fa300528a110e42fcc6afe3ee6ca17567f5192f59142aa6532b8","observation_id":"bc07b9b3-bef6-4e53-bf11-8ff2c6c5b35c","resolution":{"observed_at":"2026-08-06T20:47:20.455721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.607372Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"cf663518-4296-4430-be37-624068fe681d","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.463610Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:e5e4ae5d25e0802bee6a003203f694b7f62b524f16980a4c59079395f4b9b0d3","observation_id":"f4157507-8807-432c-8c42-20a3d1227fad","resolution":{"observed_at":"2026-08-06T20:47:22.640716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-06T20:47:20.472806Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.472806Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:d21c8878bf990e1a73032b0433fcf4eccdbd0ca60948f3ad68321f0ba3e77a35","observation_id":"ae87c9e5-3cd4-492a-9409-56fc1ef5fa57","resolution":{"observed_at":"2026-08-06T20:47:20.472806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-06T20:47:20.479734Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.479734Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:6d82a69fde46516179cc1a7303296b4a19c22b5bc2d86b3416ca41758c07d30a","observation_id":"32e106f6-2853-4358-a9fc-d2896720d3ec","resolution":{"observed_at":"2026-08-06T20:47:20.479734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-06T20:47:20.496984Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.496984Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:5822f3ef48754025256c162e37d6125b9d0bb469f2644074871bc7894848f589","observation_id":"7d40029d-22c3-4768-b5a5-d251ef5f00fa","resolution":{"observed_at":"2026-08-06T20:47:20.496984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.404606Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"c9aafee9-a351-4a5f-9ddb-2aff2762e2f1","year":2022},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.507509Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:f95cad7f09075f938ffa945ee5933f57862c175c19f08b516bd94e3a6131ec78","observation_id":"6d46e977-1dfb-4464-b064-fed8fd283b8e","resolution":{"observed_at":"2026-08-06T20:47:22.469698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.220242Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":"7d150306-c300-4c1b-bf9c-37e44e525f1f","year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.520752Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:66a816ffbe9d208849108b2cbf990e862b4da873003469f7bf79b2a844ebc28f","observation_id":"27ba02f8-e9c5-41b7-944d-3c14db794a55","resolution":{"observed_at":"2026-08-06T20:47:22.322084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.960528Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"4b6b0635-2cbf-4833-af10-97b50eec14a9","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.535323Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:e6b8accc7ef2d8c47e583324e59792029fd6d19248c06bb9e8cc14efde64fe82","observation_id":"5348b85e-9f2b-4581-aa07-f682510f00ac","resolution":{"observed_at":"2026-08-06T20:47:22.089670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-06T20:47:20.542059Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.542059Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:73e13868a97580828d96441daae1f14d02f5e9c11fd9d8994b4a37bfd18a6246","observation_id":"b8835014-03a8-4cfd-8a00-e47530bd3960","resolution":{"observed_at":"2026-08-06T20:47:20.542059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.875219Z","title":"Model- ensemble trust-region policy optimization","venue":null,"work_id":"138e93cb-2f5b-4c52-982c-2b36e1652046","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.550685Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:5dee602e34dd01f4d12ec3df6629c03945323ce3f04af5ce366bac2c48e76efb","observation_id":"86f32bda-427f-4723-aa9e-e3279ec207e5","resolution":{"observed_at":"2026-08-06T20:47:21.912607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.793673Z","title":"Knowledge transfer in model-based reinforcement learning agents for efficient multi-task learning, 2025","venue":null,"work_id":"ba1a3a68-b0b9-4ad1-ac34-083a77bfd05c","year":2025},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.559871Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:01bc91927f7e2cb57ac4448665024a0ce2a870e5be72f767811144cb572e3716","observation_id":"bb48e649-4b62-4f98-bddb-3164cd34d21a","resolution":{"observed_at":"2026-08-06T20:47:21.821531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.718529Z","title":"Multimodal reinforcement learning: A survey and taxonomy","venue":null,"work_id":"d1e2fcc2-fa37-458c-8c06-249711a98979","year":2022},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.567465Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:d846d8c755a47917e76c79543983a6510f1fb24640e4470049c4286340dfe24a","observation_id":"730faa61-02d7-4fd2-ab3a-9bb662814a4e","resolution":{"observed_at":"2026-08-06T20:47:21.759795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.578446Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.578446Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:dd3321f3c3e80efcd45860b28046dfd3936224a5612ae29ac6679388144c6ddf","observation_id":"5a7ab240-a1a4-4a21-a017-898f96770a69","resolution":{"observed_at":"2026-08-06T20:47:20.578446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T20:47:20.587023Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.587023Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:b091f4140acf0d1e8a48dfa4cf8ccbba633f331952bddecf7909721036d628b4","observation_id":"c5a911dd-e79b-49be-a946-c364248cf997","resolution":{"observed_at":"2026-08-06T20:47:20.587023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T20:47:20.593145Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.593145Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:1ed0a0bee558060736a5132ec26f4691ab851608e6c6648edb3b31ea362088e1","observation_id":"783c56b4-a279-4c40-83f3-f2bed757516c","resolution":{"observed_at":"2026-08-06T20:47:20.593145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.605112Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.605112Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:81f13708a5fdcd444edd41a35c85c444e9878bfd39ca16fff698d60037708a81","observation_id":"7b6c0716-2fa1-4c1f-ad24-0ddef9e18747","resolution":{"observed_at":"2026-08-06T20:47:20.605112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.627647Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"d65ce975-a3ea-4d87-8040-446cf5d1e365","year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.613060Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:33fcfacacc1d39a67c141fd5efc50a40101ab475d61f444dc2a851686edb8a83","observation_id":"cb37187b-bee5-4690-8fff-bb312802380e","resolution":{"observed_at":"2026-08-06T20:47:21.635312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.591518Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey","venue":null,"work_id":"66987526-ca59-4f0b-a3cb-6fa1f7475817","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.627352Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:5713420689113c32f767894c2494528d2d1862fe32136506ef69ee893a18e6e9","observation_id":"36319905-9737-4917-b7e8-8be34e6a0463","resolution":{"observed_at":"2026-08-06T20:47:21.599873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-06T20:47:20.638681Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.638681Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:7eac574dfd14bbfd0fd01abf75179905e1533105063b6fb52bcbd6e04284ef2d","observation_id":"6eb62eab-a102-4875-a46f-4e3602fb9356","resolution":{"observed_at":"2026-08-06T20:47:20.638681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-06T20:47:20.656768Z","title":"Policy distillation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.656768Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:45740abf3f8cba0f11783ae4af1cd85b18e6898b2519b2331a75d9fc35ffc69a","observation_id":"3269a788-29a1-41cb-8b7d-4c914b02014d","resolution":{"observed_at":"2026-08-06T20:47:20.656768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.544479Z","title":"Deep q-learning with quantized neural networks","venue":null,"work_id":"5d50a1ef-b75f-4025-9d4b-2212654d28af","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.664901Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:595d9ef80515dd73a588b9cc60e1b462fc1451d8b6e8c0a5b875ca8701861c99","observation_id":"302f9915-3495-492a-aec4-3b3abd2e996b","resolution":{"observed_at":"2026-08-06T20:47:21.558810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.08319","last_updated":"2021-05-16T20:44:18Z","snapshot_observed_at":"2026-08-12T00:31:47.928184Z","submitted_at":"2020-09-14T19:11:13Z","title":"Decoupling Representation Learning from Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2009.08319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.08319","snapshot_observed_at":"2026-08-06T20:47:20.851615Z","title":"Decoupling Representation Learning from Reinforcement Learning","venue":"cs.LG","work_id":"4b61171b-d725-4aa7-b989-65261fe50ba5","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.679513Z"},"links":{"cited_paper":"/paper/2009.08319","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:66279c5a48cc76785da57ca82e166a92cec431ae4d4407830f3fda71064d3bca","observation_id":"f2cf4044-61c7-444f-902d-c6a24dd9a4ac","resolution":{"observed_at":"2026-08-06T20:47:20.863019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.489487Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"a11028e6-35fc-4974-9752-f15747c0e233","year":1988},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.689489Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:ad9449ed1538ddee6e191b9a39ce5dab1c08d353912350eb60767f4769c8fc16","observation_id":"f97136bf-5aa8-4c47-b6d4-b021f26006f6","resolution":{"observed_at":"2026-08-06T20:47:21.516200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.453246Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"9adad45c-9c98-49b1-b80b-99b912f1f9c4","year":2000},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.697887Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:a7d45bf377684e9ffd152c9f119facf21b33ceeb778e08d781c3d278b863614d","observation_id":"d15d1547-8fb8-4f92-982a-973fe84e01fb","resolution":{"observed_at":"2026-08-06T20:47:21.467837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12983","last_updated":"2020-09-07T14:28:10Z","snapshot_observed_at":"2026-08-13T23:27:45.725115Z","submitted_at":"2020-06-22T17:52:00Z","title":"dm_control: Software and Tasks for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12983","snapshot_observed_at":"2026-08-06T20:47:20.708057Z","title":"Dm control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.708057Z"},"links":{"cited_paper":"/paper/2006.12983","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:972051fb541a25b6219ecfc316bc7f495d9b129c285c2ac9965455d1f4d9562c","observation_id":"3be07ffd-7cf5-420b-a070-3daf4ac3127c","resolution":{"observed_at":"2026-08-06T20:47:20.708057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.419249Z","title":"Distral: Robust multitask reinforcement learning","venue":null,"work_id":"df321d42-e971-44d4-9f61-d0f210b06160","year":2017},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.715257Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:80435cb1932ba9f7d3adefb55204c567a2c7c21372ffb7ce997111f1a9d63966","observation_id":"3ace5a2a-ea29-4d25-a4d0-dc9b791c8d92","resolution":{"observed_at":"2026-08-06T20:47:21.429968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.392949Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"d098fe8a-781c-4a7b-a355-2f82fbb3da41","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.725448Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:13a27fd91d45f47c6cb0f1b90b64758e21cf748e06ec24a003500cd5c5e8b62d","observation_id":"468cf8ab-d718-4d55-b6ae-ae543a14a9ec","resolution":{"observed_at":"2026-08-06T20:47:21.402282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.364940Z","title":"Conservative q-learning for offline reinforcement learn- ing","venue":null,"work_id":"2fdb1b9a-8ba0-40d1-a0d6-bb9f3b51554a","year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.735378Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:a9df48738b3ec97d634f3bb085319d72907fa6699f2fa279cf4bc8a36a7eed5e","observation_id":"4ee31bc2-f3f4-4faf-9008-9b8082672b42","resolution":{"observed_at":"2026-08-06T20:47:21.372696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.327490Z","title":"A survey on multi-task learning","venue":null,"work_id":"8f216e2c-bea7-4846-8c3a-32c87a942159","year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.742361Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:d1b8f2ac30a80daf443aeda929863fab56cc51643ba17acb4ccc75132a44b355","observation_id":"382e6af6-99ca-431b-83f3-ecad44d038a3","resolution":{"observed_at":"2026-08-06T20:47:21.338061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T20:20:38.725306Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.01823."}