{"as_of":"2026-08-14T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56b4e6dbf2cca2d32389d6a691e88d319d0f0849f91ed9a2e7fde981aa69326e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:23:50.399402Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21782/citation-record","integrity":"/paper/2506.21782/integrity","json":"/paper/2506.21782/citation-record.json","paper":"/paper/2506.21782"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:23:47.273749Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:47.273749Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:986addfc24d821525fdc8ad26311dfe53d187783013e291b8b4df0e038b23fb7","observation_id":"8b63a5da-96b5-493f-8e37-08a7a46ee441","resolution":{"observed_at":"2026-08-06T22:23:47.273749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:52.752449Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"1b7809d0-2e39-40e9-9869-775c6121e0d2","year":2018},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:47.418901Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:4c59a845daf69d15f1c7e6901c07377fccec2ff5d759f8f82d9600023d1113d9","observation_id":"09574043-4761-413b-90cb-947ed4e59639","resolution":{"observed_at":"2026-08-06T22:23:52.843527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-06T22:23:47.586569Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:47.586569Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:e5970f8b8a81f301cd7aa32414f213793980c8f5b84ec12ea127e3e4406f4a89","observation_id":"cb8cb75a-7d18-4af7-a56e-c25d5df41659","resolution":{"observed_at":"2026-08-06T22:23:47.586569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-06T22:23:47.743937Z","title":"Mastering diverse domains through world models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:47.743937Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:fa9042ac4f342d355d9fa6f368b97a9c0b0f2dcd4b433b1bfbb39f43eea3b7c2","observation_id":"0310f045-6613-4153-9c81-e1a73e7a9ee7","resolution":{"observed_at":"2026-08-06T22:23:47.743937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-06T22:23:47.886009Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:47.886009Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:9063557c67488d5bb4b5c4a7d931dd07442f665391bbe0a5fe304e82fcf6cb9d","observation_id":"da1ce2b2-c1a1-4059-8f5d-e8a477180d76","resolution":{"observed_at":"2026-08-06T22:23:47.886009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T22:23:48.017663Z","title":"Playing atari with deep reinforcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.017663Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:bacb10b8d02907319279597c2b53997cdbd82cd8acff89c0f2054e980cc4bda1","observation_id":"53c20a3b-706c-4f6d-9404-16c0b31728ef","resolution":{"observed_at":"2026-08-06T22:23:48.017663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T22:23:48.141617Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.141617Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:e7bd10ecbf3bf4fe7ff4e9fe0082386cd9f02efeec14e3de2907f17d2a0bdfd8","observation_id":"aaec0511-2f74-4194-8720-facda86ca18a","resolution":{"observed_at":"2026-08-06T22:23:48.141617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-06T22:23:48.240430Z","title":"Td-mpc2: Scalable, robust world models for continuous control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.240430Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:b56f7cb9cb3b09b70a1c359b27c42005443be479b5e916448580ea3397cd8751","observation_id":"a6ec3561-8e4e-4b0b-89fa-e7d6918ec85a","resolution":{"observed_at":"2026-08-06T22:23:48.240430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07350","last_updated":"2018-11-18T16:48:40Z","snapshot_observed_at":"2026-08-14T17:57:12.553024Z","submitted_at":"2018-11-18T16:48:40Z","title":"Policy Optimization with Model-based Explorations","version":1},"cited_work":{"arxiv_id":"1811.07350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.07350","snapshot_observed_at":"2026-08-06T22:23:51.277830Z","title":"Policy Optimization with Model-based Explorations","venue":"cs.LG","work_id":"8a8d06ea-2476-4225-8a00-a40269b1848c","year":2018},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.340474Z"},"links":{"cited_paper":"/paper/1811.07350","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:97c3575cd364d08f0526b3524f693d5d4b4287ab4fece0626248a0521b6ad762","observation_id":"ee5d5d53-fcec-4e23-9fe9-741c0f8baf33","resolution":{"observed_at":"2026-08-06T22:23:51.379798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:48.436730Z","title":"dmcontrol: Software and tasks for continuous control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.436730Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:f0bd45c20a86f4c7257654a12d72b8fdb351b2de5a8b73f3c917e8a416cf6840","observation_id":"d1937661-5cd9-4174-87f5-1da27bb68ce8","resolution":{"observed_at":"2026-08-06T22:23:48.436730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-08-14T00:30:45.171423Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-06T22:23:48.547874Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.547874Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:2c35bf0f8e59187cabeb726d1e3eb1b320bcf9398d6ed91d0ffccebb08f306ba","observation_id":"81a6273c-6ca9-480b-9cf9-1d8e263842e3","resolution":{"observed_at":"2026-08-06T22:23:48.547874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:52.521430Z","title":"Deepmind lab,","venue":null,"work_id":"0efee80a-1f5e-40a6-89d0-2a294e8e1a58","year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.692072Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:96aa4784f1cfceb3de42dc191a929cf00b2a250a16ca796221deb61c5787e504","observation_id":"6f525bea-36dc-4468-8bc8-62f2c11cc64c","resolution":{"observed_at":"2026-08-06T22:23:52.622746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-08-13T16:26:39.925397Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-08-06T22:23:48.993986Z","title":"Temporal difference learning for model predictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.993986Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:d925d43f185228d04f37ed7893ec3b3535cb227c2cf1b7b3321a86cedb3723bc","observation_id":"758f57f7-b5a3-47c9-8015-bdaf72ee23d4","resolution":{"observed_at":"2026-08-06T22:23:48.993986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:49.076812Z","title":"When to trust your model: Model-based policy optimization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.076812Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:7bb0745d0730144ac677027d9bd1b3f1b0de7dbe98bff0993c4adb66c1f2a217","observation_id":"e6ac20c4-3aa6-452d-a54d-0a8400623856","resolution":{"observed_at":"2026-08-06T22:23:49.076812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13518","last_updated":"2024-07-18T13:49:21Z","snapshot_observed_at":"2026-08-12T23:19:28.360680Z","submitted_at":"2024-07-18T13:49:21Z","title":"Model-based Policy Optimization using Symbolic World Model","version":1},"cited_work":{"arxiv_id":"2407.13518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13518","snapshot_observed_at":"2026-08-06T22:23:50.932961Z","title":"Model-based Policy Optimization using Symbolic World Model","venue":"cs.LG","work_id":"ed5e86bb-d648-4fbb-a978-565ba9024322","year":2024},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.148300Z"},"links":{"cited_paper":"/paper/2407.13518","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:c03a10fb3719dec7437ec686d52a5f6a8442e7c3432adf6ee7602383446dfa16","observation_id":"28891731-d7b9-4553-ad66-23096209da70","resolution":{"observed_at":"2026-08-06T22:23:51.036310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:52.308013Z","title":"Deep reinforcement learning and the deadly triad,","venue":null,"work_id":"f9abcfe2-de81-42f9-a3fc-b126b56331ee","year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.234846Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:55366043f8e558ae8f27024b365d7abe24d20b9990ebd55b112726048443270d","observation_id":"4d6e0d5e-b2b8-4d9f-a08c-a9838100d3c3","resolution":{"observed_at":"2026-08-06T22:23:52.427891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:52.074063Z","title":"Distributed prioritized experience replay,","venue":null,"work_id":"3fac8286-b283-4aae-9dbc-c9ec2afdde26","year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.515614Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:5a1a4344367148dd47f740e24dbde86fc2beee6a092e402b3aacaffbba1e7455","observation_id":"eccfcef3-33cc-44a8-ab83-e31c69edb686","resolution":{"observed_at":"2026-08-06T22:23:52.189114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:51.803499Z","title":"Recurrent experience replay in distributed reinforcement learning,","venue":null,"work_id":"a5cbdea6-73ee-40f6-ad3c-ce2fdcb565ea","year":2019},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.854733Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:c6e5201f3cc236f8dfa8f2fb91ff64bbdeef7a4b70cc62f78fa198c73538a1c1","observation_id":"fbce273d-6627-43f7-a564-fb5ab9e96ec9","resolution":{"observed_at":"2026-08-06T22:23:51.915891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01561","last_updated":"2018-06-28T06:54:39Z","snapshot_observed_at":"2026-08-14T19:48:45.374287Z","submitted_at":"2018-02-05T18:47:30Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01561","snapshot_observed_at":"2026-08-06T22:23:50.021754Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.021754Z"},"links":{"cited_paper":"/paper/1802.01561","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:36dd657877aeb38c4b18e7432813ea6df24e95b58691eda55290ae41f4d6a820","observation_id":"24d7b1a2-8640-4d15-aa2a-d20528885b22","resolution":{"observed_at":"2026-08-06T22:23:50.021754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-08-14T19:40:13.717780Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-06T22:23:49.630943Z","title":"Available: https://arxiv.org/abs/1803.00933","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.630943Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:34cb1adfaae603ec7219f8f91b5ffb72fe3910462200e369e244c5eeffc88d88","observation_id":"527e8fa6-5e32-4a07-aef6-2ff75013b1c1","resolution":{"observed_at":"2026-08-06T22:23:49.630943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:51.626742Z","title":"Model predictive path integral control using covariance variable importance sampling,","venue":null,"work_id":"f1944bc1-d119-45cf-bffe-1b19100d5f4e","year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.268097Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:860218bbbe8ea157e3d96a13de2f42e09876f247f85f80b25bf1d0884e5c5197","observation_id":"7278c1d5-47f6-445d-be5f-400836e15977","resolution":{"observed_at":"2026-08-06T22:23:51.703998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2490050","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:50.636477Z","title":"A markovian decision process,","venue":null,"work_id":"ea741f04-f9e7-4885-bff6-ebf306c2ff1c","year":1957},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.170608Z"},"links":{"citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:84d2331ad454c8eacca44f3bb6d39e167e2478ae19ba40f1b1a981bf6b5ad580","observation_id":"13d28f2e-6497-452f-bc00-5a7cdb735774","resolution":{"observed_at":"2026-08-06T22:23:50.728011Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01149","last_updated":"2015-10-28T13:23:51Z","snapshot_observed_at":"2026-08-13T08:17:37.642748Z","submitted_at":"2015-09-03T16:18:30Z","title":"Model Predictive Path Integral Control using Covariance Variable Importance Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01149","snapshot_observed_at":"2026-08-06T22:23:50.399402Z","title":"Available: https://arxiv.org/abs/1509.01149","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.399402Z"},"links":{"cited_paper":"/paper/1509.01149","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:3b75660b5a90ba1a14d338e0c0cf2b184691a6b91c9b5f3c9fa46dbc3d8a2d69","observation_id":"3b079b1f-c613-4002-a894-41ca4f39e383","resolution":{"observed_at":"2026-08-06T22:23:50.399402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-08-12T21:46:24.188813Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-08-06T22:23:48.857752Z","title":"Available: https://arxiv.org/abs/1612.03801","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:48.857752Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:4f2ad958a4b05918f698c984afdfe86bc78f3fcb5d4e1eacdd94ae8f225d6ac7","observation_id":"4e43fe24-537d-4370-b356-6cbde2b73c48","resolution":{"observed_at":"2026-08-06T22:23:48.857752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-14T17:47:25.281874Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-06T22:23:49.384353Z","title":"Available: https://arxiv.org/abs/1812.02648","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:49.384353Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2506.21782"},"observation_digest":"sha256:4830179154f89d2b71ffcb2a4b1889cede48660a1bffa32c2a148c67f3a808d5","observation_id":"f728dbd0-ed32-4b5a-8764-ceb866476c1e","resolution":{"observed_at":"2026-08-06T22:23:49.384353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21782","last_updated":"2025-06-26T21:39:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T06:57:52.965085Z","submitted_at":"2025-06-26T21:39:01Z","title":"M3PO: Massively Multi-Task Model-Based Policy Optimization"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":6},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.21782."}