{"as_of":"2026-08-17T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0680f1ea6ca04794ab96195022697f7075296dfc735e2d1a99cf604c91944360","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:37:29.933624Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:37:36.030165Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T20:37:45.261549Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"cited_work":{"arxiv_id":"2506.15446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15446","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot reinforcement learning under partial observability","venue":null,"work_id":"c88f3800-d1f6-478d-b79e-6250c8b36fcc","year":2025},"citing_paper":{"arxiv_id":"2605.17017","last_updated":"2026-05-16T14:33:34Z","snapshot_observed_at":"2026-08-16T16:26:27.955716Z","submitted_at":"2026-05-16T14:33:34Z","title":"When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T20:37:36.030165Z"},"links":{"cited_paper":"/paper/2506.15446","citing_paper":"/paper/2605.17017"},"observation_digest":"sha256:c251652b248c4ffe7e75497490e99ff433bd48855d15d455f0634e24e6146384","observation_id":"50626c59-d028-4721-9d66-d21892112808","resolution":{"observed_at":"2026-05-19T20:37:45.263201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15446/citation-record","integrity":"/paper/2506.15446/integrity","json":"/paper/2506.15446/citation-record.json","paper":"/paper/2506.15446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.511834Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.511834Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:b81f92d50c3113c5cfab47d116565128178c0769eaf73247e302f5f697e55edb","observation_id":"47aec00e-6502-43af-8802-3139c8a455aa","resolution":{"observed_at":"2026-08-15T19:37:29.511834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.517302Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.517302Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:dceae75335386fbd276c42fca8ed10ba93ef7cf8cbd7df819835c264a5e1d0b8","observation_id":"399ac21f-4282-415f-829e-b21d30473c3c","resolution":{"observed_at":"2026-08-15T19:37:29.517302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.522097Z","title":"Rudder: Return decomposition for delayed rewards","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.522097Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:976ad2d4c191e5c2f10df2be4f530ebf00b58d7f7516422de78827c7d0e725a0","observation_id":"3c5e6fef-941e-41fc-9407-1dfda27694b3","resolution":{"observed_at":"2026-08-15T19:37:29.522097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.526925Z","title":"Optimal control of markov processes with incomplete state information","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.526925Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:bb87e6d5410b6d8e661d19d9d735483652706b924c4945fbc404b3c10bd2873d","observation_id":"0e4fac02-d175-476a-ab54-53c6b373f85b","resolution":{"observed_at":"2026-08-15T19:37:29.526925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-15T19:37:29.531705Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.531705Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2c691c47d6eaa12f927e71b865450adf81fefca07b4f821848de1138bf533cb9","observation_id":"45d2ae62-49ed-481a-a99a-32d37107d400","resolution":{"observed_at":"2026-08-15T19:37:29.531705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.536697Z","title":"Reinforcement learning with long short-term memory","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.536697Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6d66c817445d0274bb1d701f42cec243164714e7ce29aa3f0483453a37dfdb3f","observation_id":"5958cc51-6da9-45ea-a146-5e56ed537992","resolution":{"observed_at":"2026-08-15T19:37:29.536697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.541631Z","title":"Augmented world models facilitate zero-shot dynamics generalization from a single offline environment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.541631Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e673f8e2c0992ce7a3080303122370e18c615d9062f85278c599f43972c24ef1","observation_id":"5d7598e5-dc2f-4475-b4e7-6791b449ef44","resolution":{"observed_at":"2026-08-15T19:37:29.541631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.545990Z","title":"Successor features for transfer in reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.545990Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6c15fc586a212605bb6cfe1e5d85b1380356e6516aa87bd7cbf7fff2852ec070","observation_id":"df418c7a-74d2-42fc-90e0-d4f9e9370ef7","resolution":{"observed_at":"2026-08-15T19:37:29.545990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07123","last_updated":"2021-01-18T15:33:26Z","snapshot_observed_at":"2026-08-16T18:51:37.854735Z","submitted_at":"2021-01-18T15:33:26Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07123","snapshot_observed_at":"2026-08-15T19:37:29.550432Z","title":"Learning successor states and goal-dependent values: A mathematical viewpoint","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.550432Z"},"links":{"cited_paper":"/paper/2101.07123","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:b47406b2e070e08b96976ed4e69f5910a538d940041633357a9e0ff0908bd6e5","observation_id":"807bbc2b-591e-476e-91d1-f08bbd0a2476","resolution":{"observed_at":"2026-08-15T19:37:29.550432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07626","last_updated":"2018-12-18T20:01:41Z","snapshot_observed_at":"2026-08-14T17:41:37.239502Z","submitted_at":"2018-12-18T20:01:41Z","title":"Universal Successor Features Approximators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07626","snapshot_observed_at":"2026-08-15T19:37:29.555410Z","title":"Universal successor features approximators","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.555410Z"},"links":{"cited_paper":"/paper/1812.07626","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:ddf2a60adeaa17ee551fe79fc0e75a3da214eb8bf0decdd2313ccb7bc55d1e9b","observation_id":"6f7f19c0-edcf-4ebc-8739-6b0b931a0ca5","resolution":{"observed_at":"2026-08-15T19:37:29.555410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.560123Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.560123Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:a1d3c982ad1c7a3902da145512a68ab0af536c27f763c89132fb19cca9a8b222","observation_id":"0f20e5ef-211b-4ca3-8052-946d5f61aa52","resolution":{"observed_at":"2026-08-15T19:37:29.560123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.564489Z","title":"Acting optimally in partially observable stochastic domains","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.564489Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:fa84c2851c4d2c3226f5388d9fc8ad06df5179501fe820a960e5c2c42b364cbf","observation_id":"7a51e508-d1cb-472c-b9eb-e962433713ee","resolution":{"observed_at":"2026-08-15T19:37:29.564489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-08-15T13:36:27.756066Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-15T19:37:29.568951Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.568951Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:800c052f53305c8721d52679678c9eb7f9d87ccd5f7b5d511a3e45c2536de908","observation_id":"18a9c2a8-f72a-47df-b564-5b3464cbbf7d","resolution":{"observed_at":"2026-08-15T19:37:29.568951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.573854Z","title":"Quantifying generalization in reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.573854Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:515a2b6641817246d72ebc6ee559039efb7730d55f4fe5750b06721268cd460a","observation_id":"7cf032f4-5977-4097-86b2-29188d804dcc","resolution":{"observed_at":"2026-08-15T19:37:29.573854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.578537Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.578537Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:a4275e184342319025ac3d678488ae1f628b0b4e81d63e80a33ba44fe7c56aba","observation_id":"71f1e26c-54b4-4b34-a55c-77caca9acb67","resolution":{"observed_at":"2026-08-15T19:37:29.578537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.583044Z","title":"Improving generalization for temporal difference learning: The successor representation","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.583044Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:dbec25e48fb6063fd2f8785f7ba6456ed36a4e0cba4d2ab0d419c574e6bf81ed","observation_id":"018f2ccd-ea2b-45d1-9a4a-544035a6d135","resolution":{"observed_at":"2026-08-15T19:37:29.583044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.587523Z","title":"Facing off world model backbones: Rnns, transformers, and s4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.587523Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e64f883b3145045825f7fcf0ac8c62112366c7697d353a6b588b5a30f0e5ee0a","observation_id":"917a2b4b-1c8a-4327-8789-f3a3e511695e","resolution":{"observed_at":"2026-08-15T19:37:29.587523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T19:37:29.592608Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.592608Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:797c3eb57c697f8d2f50cd6b187ef6f14323f5aafb7f60102a7d4824dff1bb18","observation_id":"5fd46fdc-f1da-44db-a719-a2b49aabea3c","resolution":{"observed_at":"2026-08-15T19:37:29.592608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.597239Z","title":"Finding structure in time","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.597239Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:ea53d9947f4d59d0c94fdada74f16b910270922a71dc986c1fcc419f29153b0f","observation_id":"c3a71902-fbe1-4608-abd0-7f0320dfcb80","resolution":{"observed_at":"2026-08-15T19:37:29.597239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.601741Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.601741Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:eb33f809a48f7264a99163272b610e3e7de0cca3cb39e005ec723456aa208b67","observation_id":"0b34e4d8-bf29-442c-80a1-6bf691cf607f","resolution":{"observed_at":"2026-08-15T19:37:29.601741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00123","last_updated":"2020-01-17T23:25:22Z","snapshot_observed_at":"2026-08-14T18:21:49.462789Z","submitted_at":"2018-09-29T00:52:34Z","title":"Generalization and Regularization in DQN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00123","snapshot_observed_at":"2026-08-15T19:37:29.607617Z","title":"Generalization and regularization in dqn","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.607617Z"},"links":{"cited_paper":"/paper/1810.00123","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2f6eddc8f335025216e4c1789230b9b62de53207f69ade19fa10be7348f0d3b0","observation_id":"73fc2854-b51f-4b46-831d-6332dc046698","resolution":{"observed_at":"2026-08-15T19:37:29.607617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06865","last_updated":"2019-02-28T18:32:24Z","snapshot_observed_at":"2026-08-14T17:14:38.454793Z","submitted_at":"2019-02-19T02:36:14Z","title":"Hyperbolic Discounting and Learning over Multiple Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06865","snapshot_observed_at":"2026-08-15T19:37:29.612462Z","title":"Hyperbolic discounting and learning over multiple horizons","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.612462Z"},"links":{"cited_paper":"/paper/1902.06865","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:b21763999c3e38354bdc4012fb29f68c263e24ce8db50567938a60badfbc2fb3","observation_id":"619b6e4f-3fe6-4971-9ecb-e1c500ca43f0","resolution":{"observed_at":"2026-08-15T19:37:29.612462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.617136Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.617136Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:d4254bd82fa23ecb3bf5d6289378e0c864f89bd126d43f6da2873e11f374305c","observation_id":"fde3a438-0752-4baf-9aa8-c1f66459ba30","resolution":{"observed_at":"2026-08-15T19:37:29.617136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.621574Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.621574Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:f0e5825cb3c6c9c3aec4d009b01913c374e620ce8bfd4e9891b99f25e4916630","observation_id":"2f4615da-27d2-4969-8652-9ce997cf7745","resolution":{"observed_at":"2026-08-15T19:37:29.621574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:31.019049Z","title":"Amago: Scalable in-context reinforcement learning for adaptive agents","venue":null,"work_id":"e9e3cf0c-4077-4dbd-9429-d8f8455688bd","year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.625814Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:a21dd93997263fd6e576fea75170ab75e670dee2a5d82f32b92058e2b3e63c0a","observation_id":"868ea262-eba7-4a19-a0e2-33fb4a5319d3","resolution":{"observed_at":"2026-08-15T19:37:31.024078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:31.002447Z","title":"Amago-2: Breaking the multi-task barrier in meta-reinforcement learning with transformers","venue":null,"work_id":"da5257ad-01ae-4d96-8518-68050b030608","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.631547Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:72255cd9f4982a129f6fe2815b7fc32b3eaab608f2b01e1765824ccbbfb7f5db","observation_id":"19a6fd89-7eff-4f64-8b40-6bb77964c9f3","resolution":{"observed_at":"2026-08-15T19:37:31.007717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-15T19:37:29.636036Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.636036Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e1dd9bd2ed4e00ee20014813f0867705f6ca9e8f70b535f175d623dcea12de16","observation_id":"35a9efee-c19a-4029-87b3-3a21b3c93456","resolution":{"observed_at":"2026-08-15T19:37:29.636036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.640688Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.640688Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2bf5a4cd7086c003ebc90954e48d8f73fa8bf8698e2476e3b9582c5fba1fde90","observation_id":"1a2375f2-8882-4cbb-b369-39a29f030b87","resolution":{"observed_at":"2026-08-15T19:37:29.640688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-15T13:04:28.651186Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-15T19:37:29.644594Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.644594Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:52187f6f312f652178d8e54357720192f673eed04ac66e873f501fa9d2027183","observation_id":"4e96b70a-c51c-4dac-b4a4-430d444f4b44","resolution":{"observed_at":"2026-08-15T19:37:29.644594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-15T17:22:37.525122Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-15T19:37:29.649175Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.649175Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:7ecc7b6ae6391cc125b30d073fe1102e20eded00dbf4060abf471f78d7680a64","observation_id":"cec1eb11-adb9-4954-b9fa-cd406450e963","resolution":{"observed_at":"2026-08-15T19:37:29.649175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.978067Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":"001e1cd9-1f61-4f42-8906-ff2efe2ecaee","year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.653652Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:58a007d6ad109e495ffb2b162334d6c05bd11337efcac0da01fbc89e014fa066","observation_id":"a4494390-9afd-4372-8eb9-a8cce066cecb","resolution":{"observed_at":"2026-08-15T19:37:30.982829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-17T02:57:21.304714Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-15T19:37:29.657706Z","title":"Mastering atari with discrete world models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.657706Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:9ccb588d459ef4bf6f5025a46cba4745ddb720dd3ac8f52db9baeb5f7ba2ba50","observation_id":"e7f9fcb4-037f-4854-97dd-5005adc42819","resolution":{"observed_at":"2026-08-15T19:37:29.657706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-15T19:37:29.662121Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.662121Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:799aca523659e24ca3258c6212f480f35e26151109b6993de924452afc0a76df","observation_id":"526d1092-4fa5-44ec-9586-d9fc7d2e24ab","resolution":{"observed_at":"2026-08-15T19:37:29.662121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.666961Z","title":"Contextual markov decision processes, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.666961Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:50a0d852e8befecac812a33ea57f7db96497443a11b29343ebded1f4bc54f217","observation_id":"a6803eb5-81af-46ef-a626-26547d7140fe","resolution":{"observed_at":"2026-08-15T19:37:29.666961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.671261Z","title":"Array programming with numpy","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.671261Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:71630ea268734d51a0d55bdece0e4c2ba3d7a6d628808e3ea14d1d89aa4ef237","observation_id":"958323c3-a7a9-4fc2-8b65-0c48db1a8552","resolution":{"observed_at":"2026-08-15T19:37:29.671261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.675694Z","title":"Deep recurrent q-learning for partially observable mdps","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.675694Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:89465830cb524b852ba8cf5cc20d81f1278bdcffd67f99587164184ab1921d52","observation_id":"6e5cdc20-671d-4396-9ac3-3f6f6fe3e72c","resolution":{"observed_at":"2026-08-15T19:37:29.675694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.04455","last_updated":"2015-12-14T18:44:48Z","snapshot_observed_at":"2026-08-15T12:05:15.532349Z","submitted_at":"2015-12-14T18:44:48Z","title":"Memory-based control with recurrent neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.04455","snapshot_observed_at":"2026-08-15T19:37:29.680133Z","title":"Memory-based control with recurrent neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.680133Z"},"links":{"cited_paper":"/paper/1512.04455","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:d546f45b610240ea6f10e4bf68b075deb9776b3f21bfc8ff21636da7681ee048","observation_id":"dffbaf06-fc6c-47b2-8540-f7d978c67333","resolution":{"observed_at":"2026-08-15T19:37:29.680133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.935281Z","title":"Long short-term memory","venue":null,"work_id":"806deed3-0fe6-487a-956c-30a2316c1cd0","year":1997},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.684679Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:eb80a82859f0bbb83f223c6c75c76af8d908a03b5ea87709292ee35ef4cf9c57","observation_id":"20cc5211-af52-4287-a5dc-add1e0fdd9f5","resolution":{"observed_at":"2026-08-15T19:37:30.939846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.688888Z","title":"Matplotlib: A 2d graphics environment","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.688888Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:09594e31f73edf832fd56a214f2c8fe832ca08ba6ced8c28a3938ca24d8194f2","observation_id":"b4a9fb5e-b0bf-410b-beb2-096d3fc161c5","resolution":{"observed_at":"2026-08-15T19:37:29.688888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.910058Z","title":null,"venue":null,"work_id":"2f7bfce4-6d87-4564-a442-1d5c13c82cac","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.693207Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:383db1775fffdd5fc42ceb01f5d1bf9450613eed6dcbe2716ea363a670bf4fff","observation_id":"d63be35e-9830-451e-a8fa-8f4d1fd35ff8","resolution":{"observed_at":"2026-08-15T19:37:30.914737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.894633Z","title":"Monotonic robust policy optimization with model discrepancy","venue":null,"work_id":"03922025-1c02-4a7e-8a08-3392d29ff89d","year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.697415Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6d403a0b22b0e88b00926d1b92f65da760385f5f1ba5178fe1340154cf50dfae","observation_id":"81c701c8-fac6-4b18-a580-8f718be115a5","resolution":{"observed_at":"2026-08-15T19:37:30.899413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.701983Z","title":"Planning and acting in partially observable stochastic domains","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.701983Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:5a76f5b77003f1f109b3491499a304bc1272149e664a17c2c97b61025082445f","observation_id":"fc5dd288-84eb-4f1f-b2be-b8867e5896dc","resolution":{"observed_at":"2026-08-15T19:37:29.701983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.868947Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":"acb1b983-c498-43ff-8a49-3e0de2c7bd7c","year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.706390Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:680b0a5ca2caf0b3f5c00765239138870277946cbeee984ebd7a3d7f2023867d","observation_id":"c6177a93-3c17-4a27-bb5f-5158d13e8ce0","resolution":{"observed_at":"2026-08-15T19:37:30.873696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T19:37:29.710772Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.710772Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:622b48badf8f5ef0887b23cc99e347f61edf2341de70263a258077225c17822e","observation_id":"e2565ba5-0f27-43d9-bbc7-5caaa321bd93","resolution":{"observed_at":"2026-08-15T19:37:29.710772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.715191Z","title":"Actor-critic algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.715191Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:461dd0cbe96d04de3a97880909f9f34d24d497756caaf9b6db8745b3494d0fb0","observation_id":"316fda0c-1f91-4d51-92dd-1a97e660c5b5","resolution":{"observed_at":"2026-08-15T19:37:29.715191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.844558Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"22e5ca15-027d-47d6-b7a3-323ae31c27bf","year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.719538Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:fdf83fb3b115c179942819e20b3531f9d87da2341c503368b9f25d7a0aae9f6a","observation_id":"0aab0761-f32c-49a6-bd90-a5ccccec3cfa","resolution":{"observed_at":"2026-08-15T19:37:30.849393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.829414Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"035ab0a8-0ff6-4284-8b8e-6d8f55b7a2bc","year":2019},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.723906Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:4ec4661c394651edc421245e5aaa9d0cf30dfe31144588359e3345b9dc75d281","observation_id":"da367ce7-9459-4610-a7ca-ceacf3493761","resolution":{"observed_at":"2026-08-15T19:37:30.834686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-17T05:44:04.325551Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-15T19:37:29.728341Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.728341Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:08a9436e6ec5b2ed293c28103567f1d9ef588d9fccdd5442523cf4f50aae30cd","observation_id":"5cfd831a-980d-4ee2-9d6a-d92b81f6c87e","resolution":{"observed_at":"2026-08-15T19:37:29.728341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.813490Z","title":"Batch reinforcement learning","venue":null,"work_id":"6c300349-2cb5-4a0b-b065-7584296772e4","year":2012},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.732981Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2a41a9e55ca4c9a9acfcfd1cb22ea0b7ab39c5819c5bf250106e1ea63b7fa017","observation_id":"0067d450-c1b3-4c8f-b663-c6fc30b9e3a1","resolution":{"observed_at":"2026-08-15T19:37:30.818157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.797986Z","title":"Context-aware dynamics model for generalization in model-based reinforcement learning","venue":null,"work_id":"0da1eacd-923c-45f4-ba66-0056db7198ac","year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.737738Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:f886bc2ff5d03f66f9cf4371b645b4ffc1b561b00a7e242e3bd248679cd4c2ee","observation_id":"5e06f878-525f-472e-adad-f795481a4fb4","resolution":{"observed_at":"2026-08-15T19:37:30.802726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T19:37:29.742221Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.742221Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:7a1ccfa226bc6b6a2168e3a5ed24f5de417114e5c6266755f27c4361c102a6d5","observation_id":"e4664fa5-2a55-44d1-ae18-dab3ef0786dc","resolution":{"observed_at":"2026-08-15T19:37:29.742221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08473","last_updated":"2019-07-06T05:30:14Z","snapshot_observed_at":"2026-08-14T16:44:48.432763Z","submitted_at":"2019-04-17T19:46:02Z","title":"Off-Policy Policy Gradient with State Distribution Correction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08473","snapshot_observed_at":"2026-08-15T19:37:29.746768Z","title":"Off-policy policy gradient with state distribution correction","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.746768Z"},"links":{"cited_paper":"/paper/1904.08473","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:dd07d8f684d774a76b8c02ba118e6ae66b60ca9439b8595dc01d68c8251bc25b","observation_id":"a9df9c00-9c55-42e5-beb8-3fba3fee2770","resolution":{"observed_at":"2026-08-15T19:37:29.746768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.782631Z","title":"Structured state space models for in-context reinforcement learning","venue":null,"work_id":"2ccce19a-b33e-428a-ac1b-b1770dac1190","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.751518Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e6127eceb5cc25472291098cf4b4dcd2387d8c91c95d0e5e40fb4f51f20f8667","observation_id":"c1e78f30-178c-4e9e-ba34-f1a035390933","resolution":{"observed_at":"2026-08-15T19:37:30.787481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03023","last_updated":"2022-11-10T05:13:14Z","snapshot_observed_at":"2026-08-16T16:54:51.993656Z","submitted_at":"2022-06-07T05:40:16Z","title":"How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03023","snapshot_observed_at":"2026-08-15T19:37:29.755654Z","title":"How far i'll go: Offline goal-conditioned reinforcement learning via f -advantage regression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.755654Z"},"links":{"cited_paper":"/paper/2206.03023","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2a4ac24a3b4540436378dcb40eafe24e69fa78f3b94aeb3f83aba992a5425937","observation_id":"fa96089b-dc21-49ce-8d75-5eb1e52daf8a","resolution":{"observed_at":"2026-08-15T19:37:29.755654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07516","last_updated":"2020-02-11T10:23:02Z","snapshot_observed_at":"2026-08-14T16:13:58.959866Z","submitted_at":"2019-06-18T12:08:42Z","title":"Robust Reinforcement Learning for Continuous Control with Model Misspecification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07516","snapshot_observed_at":"2026-08-15T19:37:29.760121Z","title":"Robust reinforcement learning for continuous control with model misspecification","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.760121Z"},"links":{"cited_paper":"/paper/1906.07516","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:c3a5bbbb2984a1b8014e72495fb923ada9c2fef6027dbb18d984caadc987a391","observation_id":"08750780-abcb-422c-beff-5bb4857cb255","resolution":{"observed_at":"2026-08-15T19:37:29.760121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.767432Z","title":"pandas: a foundational python library for data analysis and statistics","venue":null,"work_id":"5b4c1a98-564c-4ea9-a66a-76322711f35a","year":2011},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.764802Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:ebf7a0203a62c4a1e0a48ccde008eab3877e85877561f5e9ef488cca49b8af3b","observation_id":"b6325162-4e18-4290-9751-450323571248","resolution":{"observed_at":"2026-08-15T19:37:30.772487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.749778Z","title":"Memory-based deep reinforcement learning for pomdps","venue":null,"work_id":"f1924270-8b9d-4258-a11e-268f9aea02c5","year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.769141Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:af7f0ca7ab16230a168f0d48a88218661a78bc59eb0497ac8e74835923d2588e","observation_id":"3cd82194-0b93-42c2-bb5a-11296011faa1","resolution":{"observed_at":"2026-08-15T19:37:30.756148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.773832Z","title":"Steps toward artificial intelligence","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.773832Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6be60aa980c864035da240fddc41e5b6924c6467ade5dc862b1745708253c070","observation_id":"4acd8763-474e-426d-b984-32f648861b0a","resolution":{"observed_at":"2026-08-15T19:37:29.773832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.778130Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.778130Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e4df81236dd63dc74532e0b1d1842627973f90831f07643b7a9646625f1747f5","observation_id":"a60f4992-812f-4624-9136-81254a918629","resolution":{"observed_at":"2026-08-15T19:37:29.778130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01859","last_updated":"2023-03-03T11:25:33Z","snapshot_observed_at":"2026-08-16T15:51:05.202584Z","submitted_at":"2023-03-03T11:25:33Z","title":"POPGym: Benchmarking Partially Observable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01859","snapshot_observed_at":"2026-08-15T19:37:29.782550Z","title":"Popgym: Benchmarking partially observable reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.782550Z"},"links":{"cited_paper":"/paper/2303.01859","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:7c73f81ce6d47628a53f2bd1bc11384678eca9b69725496f84f957c894ead796","observation_id":"323129d7-14c5-4449-bc98-43eccd4e5638","resolution":{"observed_at":"2026-08-15T19:37:29.782550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.714689Z","title":"Robust reinforcement learning","venue":null,"work_id":"336e3769-a121-4b51-b352-791fee486882","year":2005},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.787224Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:0ac699f0f37f26d49be7d95001aa28ffd1b08001f3b934d812687c1bf5f46af3","observation_id":"49a2e96b-4457-41b0-942b-d83da35f6a7f","resolution":{"observed_at":"2026-08-15T19:37:30.719577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05038","last_updated":"2022-06-05T01:19:29Z","snapshot_observed_at":"2026-08-16T17:50:25.422370Z","submitted_at":"2021-10-11T07:09:14Z","title":"Recurrent Model-Free RL Can Be a Strong Baseline for Many POMDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05038","snapshot_observed_at":"2026-08-15T19:37:29.792082Z","title":"Recurrent model-free rl can be a strong baseline for many pomdps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.792082Z"},"links":{"cited_paper":"/paper/2110.05038","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:fa834dac66bc9fe12054d07572be28df4ac6a3ef984ba36be3aed855fa9b775c","observation_id":"c7d8530c-a575-4793-9688-dcc3157acc13","resolution":{"observed_at":"2026-08-15T19:37:29.792082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.796830Z","title":"Robust control of markov decision processes with uncertain transition matrices","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.796830Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:44df09ca8ee68084113fbeb57ec575f3baecb5964a88375e8553cf05d92aa863","observation_id":"4b262d7c-34f8-46c8-a5b2-fae1dd7b0b27","resolution":{"observed_at":"2026-08-15T19:37:29.796830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12282","last_updated":"2019-03-15T17:58:23Z","snapshot_observed_at":"2026-08-14T18:07:38.944749Z","submitted_at":"2018-10-29T17:51:46Z","title":"Assessing Generalization in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12282","snapshot_observed_at":"2026-08-15T19:37:29.801239Z","title":"a henb \\","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.801239Z"},"links":{"cited_paper":"/paper/1810.12282","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:8f4afd325517556f9453da1577fe2cdcca1ccd56895131bc71d80a12bfd5c638","observation_id":"68186d0b-af03-4957-908b-1541299b95e9","resolution":{"observed_at":"2026-08-15T19:37:29.801239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.805746Z","title":"Stabilizing transformers for reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.805746Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e58ebb34ac9f542a1d2ca5452c5ae4a0830414ccf462fc5ae04fc281b5955629","observation_id":"60a194a3-7aac-4a71-81bc-1a8db8f6cf3d","resolution":{"observed_at":"2026-08-15T19:37:29.805746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.678397Z","title":"Hiql: Offline goal-conditioned rl with latent states as actions","venue":null,"work_id":"40ac3968-76b1-4cf3-8e4f-7d0ce6b6a042","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.810869Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:02262a9bbab2f7896ca3652745597498f1a7bdfbcc0303062198b82b1e6d275e","observation_id":"e71ba0c2-2617-423e-a59a-b25b1ca40278","resolution":{"observed_at":"2026-08-15T19:37:30.683624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.664054Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":"0b2cc192-9c31-4ca7-bc14-9096853d5365","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.815410Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:675c87c0f6d55ec12f06e651400c2d4e7da81ebab15cc9af3895b57f7e046b69","observation_id":"8e683216-8398-4ecf-b387-9b5f5c20c041","resolution":{"observed_at":"2026-08-15T19:37:30.668577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.819694Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.819694Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6cd15b7f1675997e665ad2d476bf9d3af69521fb957969a7733477c6516a8404","observation_id":"511fde79-6680-448b-840a-3c87033fd7c6","resolution":{"observed_at":"2026-08-15T19:37:29.819694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.640231Z","title":"Fast imitation via behavior foundation models","venue":null,"work_id":"eb737667-f85e-464c-bd9d-d62a4397c3e9","year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.824782Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:e1ca0a8f53ef0aa2e5d3f8ff33ce53d609662680c3525dbee7fc70e34e078246","observation_id":"b5e4fd5d-7023-4e3b-bee2-b7e4f92dca37","resolution":{"observed_at":"2026-08-15T19:37:30.644796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12862","last_updated":"2021-02-20T12:32:59Z","snapshot_observed_at":"2026-08-14T17:42:32.556378Z","submitted_at":"2020-06-23T09:50:22Z","title":"Automatic Data Augmentation for Generalization in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12862","snapshot_observed_at":"2026-08-15T19:37:29.829176Z","title":"Automatic data augmentation for generalization in deep reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.829176Z"},"links":{"cited_paper":"/paper/2006.12862","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:4c8f1e492656457520be901e9bf5d05a68e65eb35c78d02e709cc5127ba9d4fe","observation_id":"55abfbbe-c184-4cb9-8ee9-edf199a201e8","resolution":{"observed_at":"2026-08-15T19:37:29.829176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01283","last_updated":"2017-03-03T19:58:56Z","snapshot_observed_at":"2026-08-14T21:36:41.608516Z","submitted_at":"2016-10-05T06:51:58Z","title":"EPOpt: Learning Robust Neural Network Policies Using Model Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01283","snapshot_observed_at":"2026-08-15T19:37:29.833746Z","title":"Epopt: Learning robust neural network policies using model ensembles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.833746Z"},"links":{"cited_paper":"/paper/1610.01283","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:3ef3f5ba6824381927e29398fbdcb165e870e25f12e428f424d855735b42ca19","observation_id":"2227ed27-a674-4b16-a5a0-b4056ed2ff5c","resolution":{"observed_at":"2026-08-15T19:37:29.833746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12425","last_updated":"2021-02-24T17:43:02Z","snapshot_observed_at":"2026-08-16T18:43:15.954085Z","submitted_at":"2021-02-24T17:43:02Z","title":"Synthetic Returns for Long-Term Credit Assignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12425","snapshot_observed_at":"2026-08-15T19:37:29.838312Z","title":"Synthetic returns for long-term credit assignment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.838312Z"},"links":{"cited_paper":"/paper/2102.12425","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:d2a48ff3d9c9867533a34d28f7abab9d741d102b9ea1dd084ab78d4494bea266","observation_id":"c2c8a653-fcf0-4190-8bda-e8640f52f4f0","resolution":{"observed_at":"2026-08-15T19:37:29.838312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09205","last_updated":"2024-01-24T18:32:49Z","snapshot_observed_at":"2026-08-16T18:53:07.244160Z","submitted_at":"2023-06-15T15:40:04Z","title":"Reward-Free Curricula for Training Robust World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09205","snapshot_observed_at":"2026-08-15T19:37:29.842674Z","title":"Reward-free curricula for training robust world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.842674Z"},"links":{"cited_paper":"/paper/2306.09205","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2c94144cec5b7b332a2da2b19b87038b75616bc6c0f289762cb206190ea068f4","observation_id":"09b5a9d9-404b-451b-8af9-e16407be0569","resolution":{"observed_at":"2026-08-15T19:37:29.842674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.847403Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.847403Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:09b1fc764c064cc8894a3cc3257627a2c1948fe873dbfc9873643cf7b2732eaf","observation_id":"81b78502-8f0f-4f5a-8a45-426ca853d253","resolution":{"observed_at":"2026-08-15T19:37:29.847403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.615714Z","title":"Python: a programming language for software integration and development","venue":null,"work_id":"428a5f38-9a22-4e4d-9e72-0b76b82261ed","year":1999},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.851790Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:50772567e7683fc256c0c5deb6d7784f4da577aa0acba24ec91e60b659949d24","observation_id":"4936e410-ef66-4b55-92fb-5520789b7837","resolution":{"observed_at":"2026-08-15T19:37:30.620707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.600572Z","title":"Universal value function approximators","venue":null,"work_id":"097cffa1-2eba-4c40-adc0-294965d133eb","year":2015},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.856128Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:18b0655ec896f8a8b5f5d812a77af601e73aa2b215fb75dbd2bc76d627b1a15a","observation_id":"376148d4-a25c-4f5f-a7c9-9358faec5095","resolution":{"observed_at":"2026-08-15T19:37:30.605450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-17T05:48:50.270608Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-15T19:37:29.860626Z","title":"Reinforcement learning upside down: Don't predict rewards--just map them to actions","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.860626Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:8d1cc44ff62b76e7dcaa03d6323eaee166be7f9fd7fb51e3b7f73ff6304d8106","observation_id":"38fcec82-510a-4a84-9c06-39722501636c","resolution":{"observed_at":"2026-08-15T19:37:29.860626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.584693Z","title":"Reinforcement learning in markovian and non-markovian environments","venue":null,"work_id":"a3ee10d1-f289-414d-864a-ab3c4289bfdc","year":1990},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.865474Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:678f130955759d22781bc9f3d3f248623b50f5f252bc30230b32dba1081e13c3","observation_id":"b01114b7-071b-4cea-91f1-65115677c446","resolution":{"observed_at":"2026-08-15T19:37:30.590304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.569962Z","title":"Trajectory-wise multiple choice learning for dynamics generalization in reinforcement learning","venue":null,"work_id":"ef3271de-296d-4082-94b1-483fc34e2ef8","year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.869702Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:64820a80b875191e44b4f0284290be8c175fe965e472457653a7982c6beb2714","observation_id":"1ecd03db-429e-4f0b-95c7-02500b6b485e","resolution":{"observed_at":"2026-08-15T19:37:30.574754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.873991Z","title":"Temporal credit assignment in reinforcement learning","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.873991Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:c62dd1d46da32bb82a01d9d5e766881fd3e673e9b6c4db31b75a46bd88cdcf81","observation_id":"407b2b38-e276-4752-86a2-bfd964238e72","resolution":{"observed_at":"2026-08-15T19:37:29.873991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T19:37:29.878368Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.878368Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:10a4c2fd286bfa6529cadd3c5554e51ade6f66327f139cfc869ddc3c58988665","observation_id":"2a2f8887-3798-40b0-8beb-df1ae25b0f29","resolution":{"observed_at":"2026-08-15T19:37:29.878368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02425","last_updated":"2024-05-03T18:41:13Z","snapshot_observed_at":"2026-08-16T13:55:32.178476Z","submitted_at":"2024-05-03T18:41:13Z","title":"Learning Robot Soccer from Egocentric Vision with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02425","snapshot_observed_at":"2026-08-15T19:37:29.883154Z","title":"Learning robot soccer from egocentric vision with deep reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.883154Z"},"links":{"cited_paper":"/paper/2405.02425","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:191d40056d15bf967ef719e78e0c90207a0c7449da3352f9c803f127322f1e89","observation_id":"6d4e7c52-71e6-4868-b5af-3b9062571e5d","resolution":{"observed_at":"2026-08-15T19:37:29.883154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.888157Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.888157Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:c6abbbfbd8a04ac85ec4cfdfcbcde84a21e5634a5f5d522fb8bfbff53ab475d1","observation_id":"47b145d8-d437-4e1b-9037-cdcc5700b3f9","resolution":{"observed_at":"2026-08-15T19:37:29.888157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.892663Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.892663Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6a436c1487221957e252f227e341faf311c684e0528f2cd889be0560f9e96fd3","observation_id":"a2beca31-fc93-478e-9096-a643b663d7be","resolution":{"observed_at":"2026-08-15T19:37:29.892663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.526244Z","title":"Learning one representation to optimize all rewards","venue":null,"work_id":"b8c7e04d-e5eb-4b3b-8f04-d6b5f0dc22a8","year":2021},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.897013Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:2fb7f5a818d2a14b21fa04174cd28ff5b4186d708793ea95ce02331cccaf66f6","observation_id":"966fed24-1e51-4619-a0e3-1cf3138a950e","resolution":{"observed_at":"2026-08-15T19:37:30.530779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.510579Z","title":"Does zero-shot reinforcement learning exist? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"562e804c-2b7c-4578-9026-97f231d25378","year":2023},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.901534Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:c7a1ea68c04533fecf996848900043f96a96114f5fef1b673a120107e4ce8ee2","observation_id":"e5f34fca-cc7e-4d0e-acd8-be2ac9b95955","resolution":{"observed_at":"2026-08-15T19:37:30.515552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.905823Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.905823Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:0b9669ae487b102bed310b5c938f3922f308db382b811ff2be7cda4ffdb239a3","observation_id":"de40c939-25da-42d0-8f94-1af2e11fe73f","resolution":{"observed_at":"2026-08-15T19:37:29.905823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.485038Z","title":"Active perception and reinforcement learning","venue":null,"work_id":"1f0bb3d1-dd91-4fcf-a575-30167e238b22","year":1990},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.910566Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:348c7848d376363f1e25b6baa62e0e46e635ea4e65ddd1a598521c210f370243","observation_id":"a13be115-0c55-47d0-ac2e-63fdc5df8801","resolution":{"observed_at":"2026-08-15T19:37:30.490669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.470507Z","title":"Policy gradient critics","venue":null,"work_id":"2f429473-85d0-469b-95a4-5f310d9c679b","year":2007},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.915226Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:b207e9de27b24f5c1a46c261c8c692f37d0af407bab08c2805d3c73ae222c0d6","observation_id":"e5be8a5a-1179-4702-9d08-d29702676e7a","resolution":{"observed_at":"2026-08-15T19:37:30.475027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.455614Z","title":"Meta-gradient reinforcement learning with an objective discovered online","venue":null,"work_id":"6688efd5-8e71-4e0a-a6b9-d40a3001b797","year":2020},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.919944Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:12e3313807ab2a03e62ec02bd7fec2a3c84792bfae75d17fe576a4bf00aa191c","observation_id":"2c43ebbf-cdcb-438d-a90c-89b5e2d43f8b","resolution":{"observed_at":"2026-08-15T19:37:30.460421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-08-16T17:24:43.547236Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-15T19:37:29.924574Z","title":"Don't change the algorithm, change the data: Exploratory data for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.924574Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:6edb8821e540745c1f63cb155479f83a4a5f2b61263a66dce9efb0378ee7969c","observation_id":"4e439a89-65e0-422c-8c60-62163ed0f744","resolution":{"observed_at":"2026-08-15T19:37:29.924574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:30.438758Z","title":"Learning deep neural network policies with continuous memory states","venue":null,"work_id":"2246a124-a335-4903-aae4-14fb8840adab","year":2016},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.929217Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:0041128ebd4d19d93d439764fab0a65da721980ac90a71fcac6122e3211d06c4","observation_id":"765afd43-5b4c-48f8-8968-bbf63bc2da0a","resolution":{"observed_at":"2026-08-15T19:37:30.445202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:37:29.933624Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.933624Z"},"links":{"citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:edb14d943494cf3967b495a020d123ebf5407142bedd9bf248152d8882a32fff","observation_id":"66ed7fcb-7b1b-4894-b12f-6225b0543ca4","resolution":{"observed_at":"2026-08-15T19:37:29.933624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T08:41:29.929267Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 1 inbound Pith citation observation for arXiv:2506.15446."}