{"as_of":"2026-08-13T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79ebd3ecf7d12c26ed6dff9226f703e3014a501f4663268a71f34a717a26ab24","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:33:45.062290Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T10:53:30.636580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T10:53:30.685900Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"cited_work":{"arxiv_id":"2606.21173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.21173","snapshot_observed_at":"2026-08-10T10:53:30.685900Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","venue":"cs.LG","work_id":"758d8931-8d90-4b08-8361-d0e13c7d61c4","year":2026},"citing_paper":{"arxiv_id":"2608.07301","last_updated":"2026-08-07T14:56:11Z","snapshot_observed_at":"2026-08-12T23:12:44.474925Z","submitted_at":"2026-08-07T14:56:11Z","title":"From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T10:53:30.636580Z"},"links":{"cited_paper":"/paper/2606.21173","citing_paper":"/paper/2608.07301"},"observation_digest":"sha256:f4433ee7ddb93971939374e01c55c18901aedf18350b5aac235976f91bf0d007","observation_id":"7af62fe6-01b8-44fc-9263-582ec8dc2c53","resolution":{"observed_at":"2026-08-10T10:53:30.692533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.21173/citation-record","integrity":"/paper/2606.21173/integrity","json":"/paper/2606.21173/citation-record.json","paper":"/paper/2606.21173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"A Bradford Book, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:2cd29bf9dcc330d217a0495dd0117799d75cc93931deeeaa886e9884409f594c","observation_id":"9c0c9c84-7e6a-4b7e-917b-38e6704b0f3c","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:d166a960b5757fe63440a5e500576842bd435b5b1dc18142571227cd30c4d95b","observation_id":"81131771-6cd7-466e-a130-1b899e17dedc","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Proximal Policy Optimization Algorithms, August 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:27d0e2ed9d0bed2a27a2c092d9af2196bb06ba4cb3b5043ad324de5bd837a0be","observation_id":"74cd8c33-8e89-424d-8832-11e11e39b56c","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Objective mismatch in model-based reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:fe33d3d02a098570d403013aac4d8c1daa2481a1ffb333bc9605a9f2975e32ce","observation_id":"bc689de5-4d55-440c-83a2-2244dd7ec3b5","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Moerland, Joost Broekens, Aske Plaat, and Catholijn M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:e8401bc341585c3b102f5d780b7a84b7ae72d88cddf6c1c1c1ab75028018f77f","observation_id":"122e52c0-426f-473c-ac9f-e627632e6dfb","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"The value equivalence principle for model-based reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:86aae310c8b96eb4146254c1cafa2f84b70b54d5040181425b1a1959398cf521","observation_id":"d334b879-100e-4bf1-bb98-5beb0c123820","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Proper value equivalence","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:96d30806f57a104b1236e549d4ba7b11ffac0a70418c5e53ecb07c55c990a17c","observation_id":"d668f6f7-5eea-44f6-8546-1b79f367fbe5","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Hunt, Tom Schaul, Hado van Hasselt, and David Silver","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:65872785f606b0240e21b84df0481b232911ef516dd645d303854cc0444c7456","observation_id":"519d18ca-06a7-4ecf-ad97-cea46f508357","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Universal Successor Features Approximators, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:846373effa5948b54d179a06969d4df748fdba311515c786b00c08979c1a3e0d","observation_id":"005ca6f2-3c7f-4a4b-89ab-0a5cd885dad0","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Learning one representation to optimize all rewards","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:54db7554f8801518762ced23b54ad4505c98579a181ca06bd89e0e170f35809f","observation_id":"bb126d42-7c83-4ad2-b09c-d9fbfe1cdcb9","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Universal Value Function Approximators","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:c765c7cc147a0739aaf544f306f4e1b99cb4e1219f5986b8f96a3199d2808aab","observation_id":"128eb90c-0ed5-4ace-be32-872cdbfd9b6e","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:eed6a7892bb46967ce87bbb36e93ec6a21d9023b5ff90c9cecdddeefc48e174f","observation_id":"7820cceb-8591-4f88-9b39-2c1a50e8839a","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:880b539bbe76e303520e734068cbc8e9a4ec9bc08f371371108f15ff326592f3","observation_id":"a6e5f7e2-f3c4-4781-b9cf-2de5dfe764b4","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Unifying task specification in reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:5a41b024132d100297c2b47ec5c86bd2fa52ba930c6ae7946f2d98ddf5b4bd91","observation_id":"ce715326-06e5-4007-a167-780717f6ce3e","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Neural fitted q iteration – first experiences with a data efficient neural reinforcement learning method","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:5a1b0ee91faa9c70bb18df1d364aec29022a78d7cb49f04e682ce4a11696aa6a","observation_id":"97e17cb7-3506-4c1d-ad16-a43d152a0063","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Learning to predict by the method of temporal differences.Machine Learning, 08 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:8d303fd124faffcc904e13c71923e9b34872958d2fea2b469ae468e63d2f4980","observation_id":"2957c0e4-d6b4-406c-8d3f-59d7b0a47f46","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"PhD thesis, King’s College, University of Cambridge, Cambridge, UK, May 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:98c2504bab854c75f3a361b9614ba5b645374f427662ee2ee0d0cae49e38ca4d","observation_id":"fd1d2be5-83bc-4b6f-b2de-a45c0fdca0f7","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:04cf0acf8154914eed405e88e8b9c0abfa9a3c11c433fe78840eff52b15e00bf","observation_id":"e68f5ebf-fdfa-4130-83ac-0dc692dfd26a","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:523af526bc16f7bbd119647de9fd72c5b3233fb1dc1c8a56dd0c990ea2ea1728","observation_id":"879ab0d5-1251-40ec-ab68-647efe7a1861","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Simplifying deep temporal difference learning.The International Conference on Learning Representations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:7be8ba8855133f7704df7c386f62dcae9689916f99a600eca8cc2701c67645e8","observation_id":"3219933a-2c85-49b7-ae1c-837a6dd5e5e6","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:ccdf05bce71722036ad52a50550e4681114b2797ff70d3aef3db9c3aa5682a13","observation_id":"63d40f28-ca1e-4e9e-9fc5-4893257c5e2d","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Stochastic backpropagation and ap- proximate inference in deep generative models","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:f0e6566a1cac0ad8bdc27d33a609c67edd599b555f3826ea7cf956029416fb2d","observation_id":"785a5b29-3f86-4049-a568-8c0b8b98b258","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6cc70579c7e3a01a3b5cece3ed575994f7fd2a5715da39cbeb3d1bd504a9f2c5","observation_id":"848a1fd0-9be4-4a18-af48-110b9cf637c0","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"A Stochastic Approximation Method.The Annals of Mathematical Statistics, 1951","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:47a49984e63e0c178d93d5d250c9e6fd5a4b69187dc76143e9feb7ce61633f28","observation_id":"f7541e80-d50d-4dc5-a979-9cb878e770f3","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Rechenberg","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:d5ef8a76063edb81afef1accf33251958445f863cf4e9419703fd9453705c100","observation_id":"c70d7c0a-f68a-4afe-976a-8ae19842298c","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Evolution strategies at the hyperscale, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:8d639844eb839e17432575bd6d0710d12417e63d08e1b944713d568031d63290","observation_id":"2db33a3d-7dba-47f2-b039-dde9272565a3","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Accelerating Goal-Conditioned RL Algorithms and Research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:ec5962f62dfbf3186cb5c14035770b91d1495b01e37f0aeb9e382b15dd692fb4","observation_id":"84c12722-ab2a-4c4f-8227-757d1075e909","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"A single goal is all you need: Skills and exploration emerge from contrastive RL without rewards, demonstrations, or subgoals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:1dee5d29b7a79b64efafd05d6244a8917a1419fd5fcecbe529296a7ebe108775","observation_id":"b0280a20-519b-4f25-b94d-6a2a5471049a","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:17bcd1a84cfb9d803cf4a6bcac4cccb7e5c87f7ac1ad70c8aec40092410123ac","observation_id":"b7639372-2e22-4f3a-80b1-afca7f6e9c21","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Bellemare, and Hugo Larochelle","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:f9ef67e2d4058333f34cd0c12b452a58d9608db4d25eaf3d942c95fb743b5137","observation_id":"70ddef7a-4c63-477c-a2ab-5e51e9881f7a","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Sutton, Joseph Modayil, Michael Delp, Thomas Degris, Patrick M","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:ab9fb040d8e71214ee11e70399e7a3c570065475b20d245d0c54935f141c6eed","observation_id":"0f6f24d3-f414-4a1c-ae73-de512dc51418","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Gymnasium: A standard interface for reinforcement learning environments.https://gymnasium.farama.org/, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:3fc6d02955ce0181629381a9ac8ba9897d3901b22f2e8d7fba4064e284f626e5","observation_id":"7bd775ff-b075-4190-a401-76b9e470a5b0","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:73fc92fb1f8eaffe677e7fd192cff3ca96953d23587650ec3c5438ed8bc28f95","observation_id":"36b53a4c-9e46-47e3-ad5c-1e2153589d3c","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:f3dbf36036b7c844745b2689090311c4213cc300be447908dcbc5084598518e4","observation_id":"cd5f22a2-a8bd-4279-a68c-29c8d1eb0f58","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6d76c7e7fef5a087286596f7013c798115485b5e383b1267e1c6e29edd093505","observation_id":"f88be73a-d308-4cb2-aaab-79b7080c8c5b","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Kahrs, Carlo Sferrazza, Yuval Tassa, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:f6f3e7af6915624c73db9901cf777dc2f0a07c03e31d9000d2e63f8c79f8cb4d","observation_id":"4debaaa5-36f4-4c2e-9f22-0ca2bdd229dc","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:a3dc870256a793f560be1ef85367365f80b7a03e0b8bde5b16c4b462b0ad4e7a","observation_id":"4770d060-1ddc-4999-b07e-f5bff90448a1","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"1000 layer networks for self-supervised RL: Scaling depth can enable new goal-reaching capabilities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:b5dbb9e0ecb98580ed842b275ff26aba959640714396ad749656a3ec888b4913","observation_id":"d38a868d-782d-4afe-9b45-a1ed46f13a9a","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Mastering Atari, Go, chess and shogi by planning with a learned model.Nature, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:81b87bddbf55f2e6a23540abfd9652a2a670317be787499cd3bce0e5b773c275","observation_id":"e5ac2edc-7520-4d53-8ba9-2481521bb5a5","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Iterative value-aware model learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:fa5518e91ad2d526427332853558c46ba4387930f97093329ae705215d5ba47b","observation_id":"717f200f-b0b0-4ff9-823d-2eb79e8249bd","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Unifying model-based and model-free reinforcement learning with equivalent policy sets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:e44ed8a206b142b242dee77b8d0a587b261352e7cc56c76fe3a2138aeaa07c81","observation_id":"2fd6871c-ab87-49f3-ae5e-baf278c05d45","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Bayesian exploration networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:b5291e07a0b12e84c411d5a79d15ad4e7fc86adf9f022fd7a31cc4adb14b0175","observation_id":"92e83298-34b2-4ee6-9e8f-cae0110e3a44","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Strehl, Lihong Li, Eric Wiewiora, John Langford, and Michael L","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:e482001ff8fa2e5f23c683f07e054814b71ebb9542c03f86efe88564372e5d6e","observation_id":"233e85fe-fa6b-412d-9323-47f437aa95e5","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"On representation complexity of model-based and model-free reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:5b6ecdfec46cf63d3e566cdbe61b901d887a9979bbfe3ae68bae19a6c0944d3f","observation_id":"2dbfed0c-fcba-449b-a66b-1e930af5f998","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Learning to achieve goals","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:7e3ae1d0956ddaf36274dfad2d19d1c91f88d2b0c68f39bc8eb29059d4134a32","observation_id":"e1434e72-7a61-4836-b0af-277d9b9e4d23","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05999","last_updated":"2026-07-02T13:21:16Z","snapshot_observed_at":"2026-08-03T04:11:22.767739Z","submitted_at":"2026-02-05T18:45:57Z","title":"On the Role of Computation in Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2602.05999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.05999","snapshot_observed_at":"2026-07-04T06:19:38.675518Z","title":"On the Role of Computation in Reinforcement Learning","venue":"cs.LG","work_id":"806121ab-2994-459a-b885-66b65258dacb","year":2026},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"cited_paper":"/paper/2602.05999","citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6b65e17c6d6dae005fb3379759cfa2a8d84b3ffdb9416a1e6cb8943cced8760e","observation_id":"fb8d3541-579e-47eb-8141-5da2cbb5201d","resolution":{"observed_at":"2026-07-04T06:19:38.676723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Goal-conditioned agents that learn everything all at once, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:0ee42ac76557bcb91daca7829f7341d752301103696fd1f193e4138883faa5d1","observation_id":"bb7697b3-384b-42a6-8b2e-bdc2f6c2bfc0","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"General agents need world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:c4ec26b27c984e65766cb353e74ce24e9c274c90755cd27129a143dff9b0c82e","observation_id":"03aa3f7a-70f3-43f6-a6c5-446ee40f385e","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Inferring transition dynamics from value functions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:9f26fd613b4609843cf4e8e198bc4e205a7d841f15697b91303bdd02d58738d3","observation_id":"3f2272cc-03a8-4763-b713-e3073399f67d","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"On avoiding power-seeking by artificial intelligence, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:27e6d4a24a0950e75a835ba9d4f5f14773555dbe6126ecea0dfb1fe1a5552283","observation_id":"edf6ca7a-7c06-470b-8b0f-f2e696ef8ddb","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Interpreting emergent planning in model-free reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6b88afb0e0964c1b14547095e0553e83ca4f444413a33487574b4e9e0bdcdfe5","observation_id":"1c691e96-b204-4c9a-828f-1954b197f9fb","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Improving generalization for temporal difference learning: The successor representation","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:7c2fad8a7abe6cd5413b1bd814c836afb3ed61f2bcf6e9f27251ececf7a6692f","observation_id":"db1fe10e-0c78-43c2-95a9-8975ad31ef84","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:a64ebacf574b2755345dacf9b2653e5a7bada9025b4683b5d4a919600e840ffe","observation_id":"8547d4a8-b659-4a59-8eb7-0b6150757b04","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Reward-free exploration for reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:1b5f5a2e83d9a522ca5458956f8e300aefcf9ec1c666a632b87a65bad33a9a0f","observation_id":"48d23b18-1ec4-4672-8fcf-c75fe2c6ea5c","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:982c79f00ae2d6679f5ac7eadb590d7d1f9c43033f073707b83cdb5c8bc4b842","observation_id":"23fb4771-b008-42f6-8422-07bf3715f0bd","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:9be2b374acdeca4fd5884226748959cb19e7fb5c5a09079dc1ea93d745844b21","observation_id":"a235d0c0-7f0f-486b-90da-b1bf140b7611","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Monte carlo gradient estimation in machine learning.J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6e1a24fc4a6438664e216c525b701e3d65c6cfb33d2e90114e392df490435490","observation_id":"f1af29db-560f-4b00-833d-c81aab01c653","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:29f6159180c92d61f6f21336aed0a380ebd1ca8025ba408fe7ab827accf1c9c0","observation_id":"60b0844c-b262-412a-b3fc-74268e0b92b9","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Krantz and Harold R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:221b607af017cbeb64281436f01b377b96ccd9661d0ea5b6a203e119c666ee60","observation_id":"536014d0-e5a8-4b3c-98d3-06e6aec049d3","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Folland.Real Analysis: Modern Techniques and Their Applications","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:aef643a03adddd51634f265454b59c7c461dd69707a8dbd0e4151b42df3755de","observation_id":"fa9bac1e-1144-48e3-8891-e0f1a228b6f0","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Lee.Introduction to Smooth Manifolds","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:2d545f98fc4b613e4cd47d226ccec0852c224e93724f0895cc868ee679eef50d","observation_id":"eb1d3519-ce46-4bea-a7a6-4499bd0067bf","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"University of California Press, 1955","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:daa6a1c6563e39a34e5ade74fbbcd58223875c3dbf8fcccfc339755d477aef8d","observation_id":"9d51f263-7e39-4294-8499-c0c0d0ffdc76","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Stein and Guido Weiss.Introduction to Fourier Analysis on Euclidean Spaces","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:000c03bb3ae25e955fde1cfd7fdc7120414cea757a8f5815384ef2aeef9e2060","observation_id":"43119295-71c7-47d6-87e6-24c4f8d3f496","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"gymnax: A JAX-based reinforcement learning environment library, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:f1fe842ad1996eba645640bfbaeb223e1d1209d3c4bccf1bbf8a015cf46b7260","observation_id":"86bd277f-29f9-4b72-b84f-bb9afce24b59","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"JAX: compos- able transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:45bbded602c0b1197c64a381f017235db4ee2be75e99b6a2be59e03b7a7c96bd","observation_id":"1d1b043c-7752-475a-a598-d4d9aa147608","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"test functions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:be6485e0d5bc113a7b5b8f9d86e164f0bf2a161ad477385e335b0e2e869117fc","observation_id":"e046c362-f326-44c0-b48c-c114b26e9dae","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"exceptionally rare","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:a32d383807283f902fd023492c2049763405cdecdbefb458ff34709342894657","observation_id":"090e8102-020d-43f2-901d-9f2e2b5d5502","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6834b2fb3ee6d8c4a26bcd9a9ad652564dc2b4ca7d284803ba9f43f58fc41b27","observation_id":"048e04b6-a442-4525-8284-2e8a5ced459e","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"The chosen action is realised w.p","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:011854ba85328a1e417a2c4839d0b9d4242bc37537e7db2184099d13c341a728","observation_id":"58ad8ed6-397f-4cc7-8ab2-3c8f10d91733","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:6ca9cdcbef8792618e414a33eb8520d04565d80f93c2fb38e8f2c25c1e85756f","observation_id":"4bedc458-1ca7-4734-a281-35d5c7077939","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"Four cells (4,4),(4,6),(6,4),(6,6) teleport the agent uniformlyinto the 16 cells of the diagonally opposite 4×4 room","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:9390ed242d0ebc0fd0930dd1072499fc75c16303a751864a845a265535db20b3","observation_id":"b230592c-656d-40e5-8f7a-75beafa37cf1","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:33:45.062290Z","title":"We train PQN on |G| ∈ {1,2,3,4} training goals over 10 seeds, recover ˆP via the local LP, and evaluate on the same two unseen goals as the deterministic variant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:45.062290Z"},"links":{"citing_paper":"/paper/2606.21173"},"observation_digest":"sha256:3d60c10429b386f9d2693c7d09a8109af352425619588feea267b23f7fa226ee","observation_id":"81a754dd-d499-4976-93ed-3856f489cd7e","resolution":{"observed_at":"2026-06-26T14:33:45.062290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21173","last_updated":"2026-06-19T07:26:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T11:02:17.174471Z","submitted_at":"2026-06-19T07:26:14Z","title":"Inverting the Bellman Equation: From $Q$-Values to World Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2606.21173."}