{"as_of":"2026-08-15T15:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91f6233ed3b17bbfa280df03b74fcaf83dd77dd8ad10016258a69596b0612869","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:00:57.747243Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:26:55.512461Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T14:26:55.633120Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"cited_work":{"arxiv_id":"2412.00985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00985","snapshot_observed_at":"2026-08-15T14:26:55.633120Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","venue":"cs.LG","work_id":"217192e2-0585-4131-b823-28d375a40cc1","year":2024},"citing_paper":{"arxiv_id":"2608.10453","last_updated":"2026-08-11T04:06:47Z","snapshot_observed_at":"2026-08-15T14:18:03.188342Z","submitted_at":"2026-08-11T04:06:47Z","title":"From Privileged Control to Deployable Adaptation:Fusing Mechanism-Guided Task Reduction with Learned Behavior","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:26:55.512461Z"},"links":{"cited_paper":"/paper/2412.00985","citing_paper":"/paper/2608.10453"},"observation_digest":"sha256:541a8f7f6d3e5f8a7ebf87117dfd060ca71416882893b035b6d51b2ef2e1d67c","observation_id":"f38b7a78-764e-4ec2-b036-b1b2c930fbd7","resolution":{"observed_at":"2026-08-15T14:26:55.639602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00985/citation-record","integrity":"/paper/2412.00985/integrity","json":"/paper/2412.00985/citation-record.json","paper":"/paper/2412.00985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.378425Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.378425Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c379f8c58bf79d80fe4e1dd6eb964dd87dd0f8429628aac7f93f5d18b4ab0921","observation_id":"e7163470-73cd-472d-b4a6-f1ebc205c09e","resolution":{"observed_at":"2026-08-12T05:00:57.378425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.383149Z","title":"Learning dex- terous in-hand manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.383149Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:3db3b045b1994d05b2179948295b9f9304a3295568d4890d0edf9382189bf2b8","observation_id":"5cbeeea6-e844-492d-99e6-5820f41ad289","resolution":{"observed_at":"2026-08-12T05:00:57.383149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-14T21:35:45.210326Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-12T05:00:57.387345Z","title":"Safe, multi-agent, reinforcement learning for autonomous driving","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.387345Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5634999e53d9b60de957d5a55b9031d5baacfe8eeabc416aad2139a4c1d5922e","observation_id":"1dd38f47-686d-40a7-a6b4-632b05f0de02","resolution":{"observed_at":"2026-08-12T05:00:57.387345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.392093Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.392093Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:153a391f80981d420cb0611779501b9eb332dce24730e45c0d5085446211ce8f","observation_id":"ea9f9c37-b818-4012-99d4-d365c7d89a29","resolution":{"observed_at":"2026-08-12T05:00:57.392093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.396226Z","title":"Pomdp-based statistical spoken dialog systems: A review","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.396226Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:2173e57f8c47698c36916edb0caed4fce54af95caffb404f18f43bc60c8d867f","observation_id":"6cd51fa3-3e5b-4ea3-b2a2-72417c621d80","resolution":{"observed_at":"2026-08-12T05:00:57.396226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.400361Z","title":"Informing sequential clinical decision-making through reinforcement learning: an empirical study","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.400361Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7a6da6ebabebd2cef621387d3ff97c969627fb912ee98b99147cf39995b1005c","observation_id":"c90bb442-a7bd-4b7e-8cb8-45907d5e3881","resolution":{"observed_at":"2026-08-12T05:00:57.400361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.404638Z","title":"The complexity of markov decision processes","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.404638Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:a449c7f96f6d7cad2a608e6a4fa4da72e988aaf7cc60d0d8e36908a0fddc0623","observation_id":"a70d1743-7a2a-4167-b3e5-3c6ae7eb9f07","resolution":{"observed_at":"2026-08-12T05:00:57.404638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.408509Z","title":"Pac reinforcement learning with rich observations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.408509Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ade648beead2c0531f18b8f5f156f87cf32f4cba24f6920123c76196ace0019f","observation_id":"23b1aab0-39eb-4063-bc2a-0f7b5c539fe7","resolution":{"observed_at":"2026-08-12T05:00:57.408509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.412288Z","title":"Sample-e fficient reinforce- ment learning of undercomplete POMDPs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.412288Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e315f400e62e6241a76c87f1b4a2fdd68df82b0067aa1d6fd32a8df5af5db79a","observation_id":"6edf07d0-4530-4dc5-9c96-d945087cfccc","resolution":{"observed_at":"2026-08-12T05:00:57.412288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.416105Z","title":"A counterexample in stochastic optimum control","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.416105Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d49c6e2cf531b24fbf3a37eb6e6c56355aefca3c2309acd7c6f8e569c9820a2f","observation_id":"35341c44-0538-44a0-ad0d-25693ee815aa","resolution":{"observed_at":"2026-08-12T05:00:57.416105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.419988Z","title":"On the complexity of decentralized decision making and detection problems","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.419988Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:560930c005a0249e5d315f9dcdce728ff26ed5e37bcbfa3d3814056113f20a0c","observation_id":"85cdf6c5-84e0-402f-add6-a0d965b262bd","resolution":{"observed_at":"2026-08-12T05:00:57.419988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.424233Z","title":"Multi- agent actor-critic for mixed cooperative-competitive environments.Advances in Neural Informa- tion Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.424233Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:15377339df165e97f26078d7947b8c2d1a88ea2b9a3eb26fb8020e534cea3426","observation_id":"0e9392e0-05ed-48ab-a20b-8989b49afb6f","resolution":{"observed_at":"2026-08-12T05:00:57.424233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.428099Z","title":"QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.428099Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:25def852254cd0f460c3e655088c0b9895a5e09b263326a8221c8eaf4b7b1368","observation_id":"4f837fb5-a935-4d6e-b68f-d7ec928e50b6","resolution":{"observed_at":"2026-08-12T05:00:57.428099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.431857Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.431857Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:a18d9f138b34a1acb09be0290c520353f39f990fac7b7bcdfcc40a9350d8921c","observation_id":"0b6db165-42da-4fcc-b2dc-b38653b2e6c9","resolution":{"observed_at":"2026-08-12T05:00:57.431857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.435449Z","title":"Grandmas- ter level in StarCraft II using multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.435449Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e0bd7bec08ab01cd9829f7b7d5f1345a90fcfe4a72a8e204bdccbc84d4b19839","observation_id":"4ae1370d-cfe2-4e80-9d80-3e49b8411cd9","resolution":{"observed_at":"2026-08-12T05:00:57.435449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.439379Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.439379Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:675c3e3ad57706f0ababe98b9206710c142eb3c6e4b883b75f8757bbc2c5c23f","observation_id":"209f5775-dff3-4ee1-8fbc-63ef7fd0f64c","resolution":{"observed_at":"2026-08-12T05:00:57.439379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.873770Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":"dd492ce6-fba9-4c36-a483-219b8cc34edd","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.443169Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7fa0150716f7593b392704cc2d0a9ce6d2037286eac80db5aa8e2f051745dc7d","observation_id":"b086a5a3-43c3-4730-9c9c-83b87f90fc3f","resolution":{"observed_at":"2026-08-12T05:00:58.877864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.861515Z","title":"Learning by cheating","venue":null,"work_id":"b1ab5306-4ec6-4fe1-8b29-ea2159e101c3","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.446983Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:26af8490f302aa5b24f6a2a07bab9599b9a124073373e107fd6eeffe1eb40e31","observation_id":"72e2ad17-e185-48ce-962d-7f900b515742","resolution":{"observed_at":"2026-08-12T05:00:58.865509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.849364Z","title":"Asymmetric actor critic for image-based robot learning","venue":null,"work_id":"10d07bf0-7e90-49f2-874f-9629dbadff2d","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.450732Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:88071fdfcf27015cf3a158b978d87a062c3e255d429a0928e31b93dd8c3289bc","observation_id":"f8827aa1-a12f-4b16-b09e-b5af8efc6b35","resolution":{"observed_at":"2026-08-12T05:00:58.853512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.837084Z","title":"Learning in pomdps is sample- efficient with hindsight observability","venue":null,"work_id":"211a1934-b1c5-4b05-b3ea-b2168cfdfc04","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.454380Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f049ad01f8ece82b051a585c403969a8d8f4b3bff77c38cd7225579726244355","observation_id":"3dbd4a4d-4b10-4558-9917-3494ab24f717","resolution":{"observed_at":"2026-08-12T05:00:58.841243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.824314Z","title":"Sample- efficient learning of pomdps with multiple observations in hindsight","venue":null,"work_id":"64a9ae3f-22c4-44b1-9835-e7d4f3a2215d","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.458190Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:9700abb07e6f43b04a10bc45135757ca0143c561022582c1cb0a682921b8a382","observation_id":"4833688b-eb7c-41d0-a7a8-da1d7b233706","resolution":{"observed_at":"2026-08-12T05:00:58.828703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.812003Z","title":"Learning in observable POMDPs, without computationally intractable oracles","venue":null,"work_id":"e2bc1d64-365e-48cf-8175-664bb8314a95","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.461960Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ccf1966766c831c558b6e61487e27e90580a4e408b41a7d8bf171102b1cd3af2","observation_id":"afb14ff5-9add-461f-830f-dd4432bae525","resolution":{"observed_at":"2026-08-12T05:00:58.815988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.799423Z","title":"On oracle-e fficient pac rl with rich observations","venue":null,"work_id":"cdb5cde7-36f1-4c11-9322-7a8f68bf401b","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.465780Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:12f741905802a69f3bbc84012e59ba015f045b883e665926d76a80ea1459f21a","observation_id":"6b6818fe-b22c-491d-854c-f95eb52a8bed","resolution":{"observed_at":"2026-08-12T05:00:58.803818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.787422Z","title":"Provably e fficient rl with rich observations via latent state decoding","venue":null,"work_id":"7ae075b0-e4df-4d69-9a0c-9191e0dd7ff9","year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.469539Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:13721b45114a69e6dc1969c482a7abebe365682f405408661a0dae99eaae0f35","observation_id":"47c406f7-1a2d-4fae-afdd-5786d14ebff9","resolution":{"observed_at":"2026-08-12T05:00:58.791388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.775235Z","title":"Kinematic state abstraction and provably efficient rich-observation reinforcement learning","venue":null,"work_id":"1349ec6d-3da3-4975-bdca-386bc7f31443","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.474307Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f4ec3d014dc2d901e0f8d8d4b25664b5cee3ecadb7d6f4b694dd618c91dc590d","observation_id":"cc6b3e90-541e-4674-8d86-9ce17c4e78f7","resolution":{"observed_at":"2026-08-12T05:00:58.779272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03774","last_updated":"2024-04-04T19:35:41Z","snapshot_observed_at":"2026-08-13T00:37:26.026790Z","submitted_at":"2024-04-04T19:35:41Z","title":"Exploration is Harder than Prediction: Cryptographically Separating Reinforcement Learning from Supervised Learning","version":1},"cited_work":{"arxiv_id":"2404.03774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03774","snapshot_observed_at":"2026-08-12T05:00:57.886042Z","title":"Exploration is Harder than Prediction: Cryptographically Separating Reinforcement Learning from Supervised Learning","venue":"cs.LG","work_id":"2125c8d5-5cdf-4b95-b3ec-2a390055106c","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.478097Z"},"links":{"cited_paper":"/paper/2404.03774","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:db95e4a51c60a37cc4f90c462e59442a238148121e43152b49a7aa372ce6d325","observation_id":"217b5634-c3f1-4990-989d-548706502368","resolution":{"observed_at":"2026-08-12T05:00:57.892712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.762623Z","title":"Provable reinforce- ment learning with a short-term memory","venue":null,"work_id":"eea7d424-2e76-42d7-aba3-ce5a9278e636","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.482113Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f78db36b600562c4aaa23507d0306c4eb2720da479c313bbc4424788a38dc12f","observation_id":"d6220eb8-cd38-4b8b-b43c-fb142e56c383","resolution":{"observed_at":"2026-08-12T05:00:58.766737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.750392Z","title":"When is partially observable rein- forcement learning not scary? In Conference on Learning Theory, pages 5175–5220, 2022","venue":null,"work_id":"bfd77d9b-82ed-441e-853a-63d1440e6f31","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.486135Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:33504353e8f5e424ccb015b3f333398dc0568cad6986cf100fc4ba29ec9092d7","observation_id":"cd64147e-b6ea-4d4e-9728-8d54b405e90e","resolution":{"observed_at":"2026-08-12T05:00:58.754554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.737847Z","title":"Partially observable multi-agent RL with (quasi-)e fficiency: the blessing of information sharing","venue":null,"work_id":"aa8807ce-a31b-4d59-b110-02ca094684b2","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.489987Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c2200499a6dd6a0a7e1910272e7083a2a3d02780383e6fb272b4f4a91ca71d1c","observation_id":"737e6c1e-7190-412b-909f-d6d980fe8e94","resolution":{"observed_at":"2026-08-12T05:00:58.742068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.725574Z","title":"Schapire","venue":null,"work_id":"530ca053-0cb6-47de-a2a7-3368ff21eaa1","year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.493807Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f5e341fd4adba6012b4b2dc7cd5b9ede0cab16e3951c0234453b4f55ebecd931","observation_id":"c383ef95-b6ce-471b-b251-94451ae6aab7","resolution":{"observed_at":"2026-08-12T05:00:58.729516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.713240Z","title":"Represent to control partially ob- served systems: Representation learning with provable sample efficiency","venue":null,"work_id":"e4658313-0521-40b9-a9e2-36c6f5e0d296","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.497654Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:dfeafdb648a5e2c681f1de14173f0fa77a167c549fa708b0fb17811a2fb49447","observation_id":"48aa0392-b631-4fd2-89ff-f49f5db7b751","resolution":{"observed_at":"2026-08-12T05:00:58.717368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.700702Z","title":"Partially observable RL with b-stability: Unified structural condition and sharp sample-e fficient algorithms","venue":null,"work_id":"1ebb5f69-9f37-4994-8d24-21b0eb2e9891","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.501395Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:76b5cc92e1399686bd217b0a4add17e6c3123d028c4e5aa0c40c54d0e97f895e","observation_id":"e2754bc8-d010-4a96-be31-39ae8a9d93a3","resolution":{"observed_at":"2026-08-12T05:00:58.705076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.688129Z","title":"Reinforcement learning from partial observation: Linear function approximation with provable sample e fficiency","venue":null,"work_id":"89011c9d-ab55-4db1-bc2d-e2e07cf74f56","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.505120Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f034c501a67fcffa68e2e512739baa8b17cb2f106be41e1c9be5dbc8aaf67764","observation_id":"af9dad91-3fc7-48d2-89f3-f5753195c22f","resolution":{"observed_at":"2026-08-12T05:00:58.692309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.675758Z","title":"Pessimism in the face of confounders: Provably efficient offline reinforcement learning in partially observable markov decision pro- cesses","venue":null,"work_id":"27be56ed-b9e4-4e1d-836d-d4231fc8c6a7","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.509825Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b4d364e63a08300a959dab9dd1a2619d462e33035d7fb6d437a9141fb7641cd9","observation_id":"b66ce82c-c450-40e6-93c4-2050fb6e6a4f","resolution":{"observed_at":"2026-08-12T05:00:58.679947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.663214Z","title":"Optimistic MLE: A generic model-based algorithm for partially observable sequential decision making","venue":null,"work_id":"7e202926-5005-4b25-99fd-2d9a12b4be09","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.513652Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5c213edacc7d3342d0b756f541e54b692bfae00a199f17bf2fac02df6e7da1c7","observation_id":"aec8ff2d-a16a-497f-9e24-2e5ac3d3718c","resolution":{"observed_at":"2026-08-12T05:00:58.667308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.650704Z","title":null,"venue":null,"work_id":"00467bcc-9d05-417e-a0f9-1c374dc72e7a","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.517747Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:748eaa3bf75aa645ab9c9796f2ae5ef7ea3ad41a96e06afe82248c67faa25045","observation_id":"86df68e4-ed4d-4a4f-8aa1-6c371f8fe8fd","resolution":{"observed_at":"2026-08-12T05:00:58.655043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.638439Z","title":"Partially observable multi-agent reinforcement learning with information sharing, 2024","venue":null,"work_id":"abc6ca77-b80e-4c78-bdb5-93ec13f3685f","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.521399Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ad99e947bb13f95182d122256144fc972978e30ffb707515c69fe2b358ce2edb","observation_id":"72599437-b993-4eb5-a50e-1f38ec65ac56","resolution":{"observed_at":"2026-08-12T05:00:58.642424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04735","last_updated":"2022-03-23T15:26:15Z","snapshot_observed_at":"2026-08-13T16:59:57.032182Z","submitted_at":"2022-01-12T23:16:37Z","title":"Planning in Observable POMDPs in Quasipolynomial Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04735","snapshot_observed_at":"2026-08-12T05:00:57.525271Z","title":"Planning in observable pomdps in quasipolynomial time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.525271Z"},"links":{"cited_paper":"/paper/2201.04735","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:3bc49d1082c9a941c5f22d47e2a3ac5a820ca038828049d9d65c72a989a124d8","observation_id":"105fcce5-289a-46c5-bcf2-969200142602","resolution":{"observed_at":"2026-08-12T05:00:57.525271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.625865Z","title":"Planning and learning in partially observ- able systems via filter stability","venue":null,"work_id":"ea744b54-bcc3-46f8-af0f-6e31b80b51f1","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.529316Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b1a0d41fd676dd32c0da2405f12c03d8f77ef47f69ba0672b2b7be452d28e0f3","observation_id":"8cb4df1d-8d25-4114-9ec0-02605981450a","resolution":{"observed_at":"2026-08-12T05:00:58.629812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.613631Z","title":"Theoretical hardness and tractability of pomdps in rl with partial online state information, 2024","venue":null,"work_id":"1db1d65f-eb91-48a9-a2ab-5e9b7bed3a7d","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.533144Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6e7c52e44af00857b33c19f8a599f70e12d60f928d620cd269b3c14cfb46a0c7","observation_id":"4b795815-13fc-490f-a582-00a8188a81bd","resolution":{"observed_at":"2026-08-12T05:00:58.617712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.601064Z","title":"Leveraging fully observable policies for learning under partial observability","venue":null,"work_id":"75817724-0847-43b6-8203-51397eb00e7d","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.536883Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7c08f8136f0a4b9982e8ad583d56a3898a8198e3a8b4a55735f54b10b8c803a9","observation_id":"311d25fe-b0d2-4841-a9de-df18d7812141","resolution":{"observed_at":"2026-08-12T05:00:58.605312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.588865Z","title":"Learning to jump from pixels","venue":null,"work_id":"dfb90cab-df00-4845-8201-6b4e50056145","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.540594Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c7e802318e8b569b0029554f8b142c5750559e7b1a870980eaa19d07dc4aeb9c","observation_id":"8343e49c-fd3a-448d-994e-3cd4802dda99","resolution":{"observed_at":"2026-08-12T05:00:58.593020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.576821Z","title":"Tgrl: An algorithm for teacher guided reinforcement learning","venue":null,"work_id":"2237ba2c-2c6f-4763-a49d-eb39d2569b5b","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.544380Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6f20aef732f1ba3f5e9b1d7b3ef77deecfb217ecbebff38f0fcbd1ce00e18942","observation_id":"dca28fe8-bbb3-4f3e-9302-f672302aeb71","resolution":{"observed_at":"2026-08-12T05:00:58.580773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.564216Z","title":"Asymmetric DQN for partially observable reinforcement learning","venue":null,"work_id":"8751bf27-dbca-4bff-8b5e-dbe23fcb4f3e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.548314Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:3dff98171e7d4c02cd7f9d2da6e01134b55c0aad3b8408d268762a6630bff082","observation_id":"27473edb-659a-4496-8580-a62aae1ad57c","resolution":{"observed_at":"2026-08-12T05:00:58.568365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.552139Z","title":"Perfectdou: Dominating doudizhu with perfect information distillation.Advances in Neural Information Processing Systems, 35:34954–34965, 2022","venue":null,"work_id":"7e81fbd5-8a6b-4213-850c-02c316d5b28e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.552052Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5ebc820f92dc578cd1b0831b3e5a87c19b23fa91aeb1c8a7654186b511084cb8","observation_id":"73818330-0008-423b-82cd-5428279c758f","resolution":{"observed_at":"2026-08-12T05:00:58.556140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.539712Z","title":"Towards unifying behavioral and response diversity for open-ended learn- ing in zero-sum games","venue":null,"work_id":"00d99746-a828-4278-a958-8b641ab887b7","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.555842Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6348447519bb36a6cf0d2486a699c98936b0b5a0beece227e19abcc32ec72458","observation_id":"86c05e3a-ba6c-4130-ad4c-fc2068feb608","resolution":{"observed_at":"2026-08-12T05:00:58.544002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.527129Z","title":"Unbiased asymmetric reinforcement learning under partial observability","venue":null,"work_id":"fd02ed20-25cb-4a16-ab49-34558928116e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.559621Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5495121fad785d2002456c5cc594ff8bcf092c7c321fb6b7bca8acf26737bf48","observation_id":"46cfd868-9448-4408-8a6d-965ecd08c15e","resolution":{"observed_at":"2026-08-12T05:00:58.531166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.514715Z","title":"A deeper understanding of state-based critics in multi-agent reinforcement learning","venue":null,"work_id":"2b7f2050-b446-41fd-b732-23d6e6521d10","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.563346Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:186b3f6f71d484229a25ee5b2ff934ce73da48fd4409ef9f226dcc634ea928e3","observation_id":"d18c399a-2656-4fb1-9490-1eb289e362f7","resolution":{"observed_at":"2026-08-12T05:00:58.518806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.502163Z","title":"On cen- tralized critics in multi-agent reinforcement learning","venue":null,"work_id":"d4cada1a-f741-4ce8-8f0d-3328d4aa1c35","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.566988Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:28f43cb4af2c65e14a8e764c3c51af9b353a75ae7eb84267100792db23c23cc0","observation_id":"992bd910-ae36-4806-9b81-d38c65da0108","resolution":{"observed_at":"2026-08-12T05:00:58.506483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.489818Z","title":"Learning belief representations for partially observable deep rl","venue":null,"work_id":"bd58caa3-3d0d-46d5-ab29-c39c27263c0e","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.570730Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7f22c462b0cedd249ac648fd9736a05cd2b5277a120d6df83a2161c46919aecd","observation_id":"2e1a4770-5d02-4db9-b30e-1e7d478fe43c","resolution":{"observed_at":"2026-08-12T05:00:58.493910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.477496Z","title":"Learning belief representations for imitation learning in pomdps","venue":null,"work_id":"4ff9d778-e207-4155-9e2a-36c13ae50b12","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.575636Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:25c2ce545bbb1db25167ed7ce6d096b50a7bffc91b71e765b10c2fd383764faf","observation_id":"c202d67a-d224-46c0-8f92-717a8020d41d","resolution":{"observed_at":"2026-08-12T05:00:58.481653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.465145Z","title":"Belief-grounded networks for accelerated robot learning under partial observability","venue":null,"work_id":"0a6b3b80-ed9f-4ab8-b07e-5e093dda7eae","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.579698Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c19c31cbe04d869f00997ba8eb2eeb7c911c0d56da11b860ab02f88690eab357","observation_id":"bf86327d-f6bd-452b-95fd-7fd78af64a55","resolution":{"observed_at":"2026-08-12T05:00:58.469046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09086","last_updated":"2021-06-16T19:00:53Z","snapshot_observed_at":"2026-08-13T19:02:34.396415Z","submitted_at":"2021-06-16T19:00:53Z","title":"Learned Belief Search: Efficiently Improving Policies in Partially Observable Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09086","snapshot_observed_at":"2026-08-12T05:00:57.583507Z","title":"Learned belief search: Efficiently improving policies in partially observable settings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.583507Z"},"links":{"cited_paper":"/paper/2106.09086","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5f293673b86842dc53e7956fec01000f50ac9ff27da24ad2d266073dfa6b4891","observation_id":"1b8675e2-1378-493b-9b45-0aae522d1133","resolution":{"observed_at":"2026-08-12T05:00:57.583507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.452576Z","title":"Flow-based recurrent belief state learning for pomdps","venue":null,"work_id":"8e8a00a1-0b34-438b-899c-f4a3b70dcd4c","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.587635Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:11218c0ec4b42614569cc27050128df981bb5d560562a74ed51610a12b955d1d","observation_id":"892cabc8-9d4a-43ba-b625-39329c5c8d51","resolution":{"observed_at":"2026-08-12T05:00:58.456809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.440463Z","title":"Belief state actor-critic algorithm from separation principle for POMDP","venue":null,"work_id":"bf781fa0-e90a-41d6-873a-05c053e675a5","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.591604Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:83db0dd2a89352aaadef6b1a2f421a42e9fd8e30e59a3d1b7637b70467280a8a","observation_id":"4084d94e-4e65-4da7-8968-b4cec9add4ab","resolution":{"observed_at":"2026-08-12T05:00:58.444516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.427789Z","title":"Neural belief states for partially observed domains","venue":null,"work_id":"a19267ce-95f5-444e-91b3-672fd21c5618","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.595393Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:2466e4e002bf0dc7abdd97bed49e85181849dd15b66aab287c0841eeff47d414","observation_id":"2882b484-5216-4df3-82a5-5405accbbe24","resolution":{"observed_at":"2026-08-12T05:00:58.432094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.415095Z","title":"The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models","venue":null,"work_id":"f68b9e3c-fa01-4a32-a200-e3d36b6b2968","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.599071Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:df05506cc9c43d8f72bbab00151aaf5d85da9a40fe368c42df1633abf29a7184","observation_id":"6691a7d0-4711-4ad8-b0b7-68895a1f9f99","resolution":{"observed_at":"2026-08-12T05:00:58.419475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.309408Z","title":"Common informa- tion based markov perfect equilibria for stochastic games with asymmetric information: Finite games","venue":null,"work_id":"6ffd6f9f-44ca-4f70-be67-1998f19ca400","year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.602837Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:a87ca03762e5322a4ca456d9f7b8f98ca399c0099bcc1bbabfe6ba9ef52cf19a","observation_id":"7f616ca9-4ad1-4b58-9440-50b8e78a14f2","resolution":{"observed_at":"2026-08-12T05:00:58.313480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.297188Z","title":"Decentralized stochastic con- trol with partial history sharing: A common information approach","venue":null,"work_id":"3d9acb7f-e873-4068-ae65-7b74d2c37b90","year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.606535Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e7c1d18e010156ccdbfe8c008b335020d774bb14a1b82b30e50b9cdc88d37f12","observation_id":"af3b9a8a-b593-4bc1-812a-06b5c13054bd","resolution":{"observed_at":"2026-08-12T05:00:58.301288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.285098Z","title":"Sample-e fficient reinforcement learning of par- tially observable Markov games","venue":null,"work_id":"ca8545ce-df7d-446b-a5f1-97e07973d26f","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.610519Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f6b9818b756277f943af922ed4bb2b0b105b0bfa8db2390678681b9c7718fa4d","observation_id":"cd4d198c-2a00-4d7f-a17b-ade838f12842","resolution":{"observed_at":"2026-08-12T05:00:58.289167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04184","last_updated":"2022-03-31T12:12:43Z","snapshot_observed_at":"2026-08-13T17:57:08.953586Z","submitted_at":"2021-10-08T15:06:22Z","title":"When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04184","snapshot_observed_at":"2026-08-12T05:00:57.614294Z","title":"When can we learn general-sum Markov games with a large number of players sample-efficiently? arXiv preprint arXiv:2110.04184, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.614294Z"},"links":{"cited_paper":"/paper/2110.04184","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:48b52a80916dc13bd8d1a63889ec5754b49d5102591515fa173ee264ce8be867","observation_id":"4df6750a-8ad8-4153-98ff-fc5ce1da62c0","resolution":{"observed_at":"2026-08-12T05:00:57.614294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.271389Z","title":"A sharp analysis of model-based reinforce- ment learning with self-play","venue":null,"work_id":"268c94ef-8879-4b3e-bfd3-9825388b83e6","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.618444Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:48efb510c08e356e228d338521986262ffa2f50aa87cea9608217cbc9a320dd7","observation_id":"6ec2666b-1ae8-49a4-bb75-441e8eb21da6","resolution":{"observed_at":"2026-08-12T05:00:58.275849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14555","last_updated":"2021-10-27T16:25:55Z","snapshot_observed_at":"2026-08-09T10:31:53.237354Z","submitted_at":"2021-10-27T16:25:55Z","title":"V-Learning -- A Simple, Efficient, Decentralized Algorithm for Multiagent RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14555","snapshot_observed_at":"2026-08-12T05:00:57.622093Z","title":"V-learning–a simple, efficient, decen- tralized algorithm for multiagent rl","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.622093Z"},"links":{"cited_paper":"/paper/2110.14555","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c492ef1eba579b0102a7d46a078ec1ff99e6b8c02331243b0cb96f6aad9915d7","observation_id":"38b72e48-4179-4bd1-ad2b-17174936a734","resolution":{"observed_at":"2026-08-12T05:00:57.622093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.259388Z","title":"Algorithmic game theory","venue":null,"work_id":"bff6b6c8-1784-4064-97b0-c831ffa0f650","year":2010},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.626139Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:06312bbfc2f738e5f5bd3e7ab4265dc155889555a41b5af6e0b2bf4ca414d66b","observation_id":"b2b1acf5-a996-4570-8c66-3f65afcea8f3","resolution":{"observed_at":"2026-08-12T05:00:58.263260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.247258Z","title":"Kakade, and Yishay Mansour","venue":null,"work_id":"ff815fcc-7a53-45c3-9623-01dff93276fd","year":2007},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.629852Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:92a5c4dc3c7e06d9adb48325b6baf5ebe3075a689863564844ad0acc231f6e5b","observation_id":"413df1b0-1e47-4182-8beb-ead88dbc369f","resolution":{"observed_at":"2026-08-12T05:00:58.251251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.234430Z","title":"Common information based markov perfect equilibria for linear-gaussian games with asymmetric information","venue":null,"work_id":"05cade9d-29f4-485d-a26a-71e6ec18ddeb","year":2014},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.633736Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:1f7898573f59b63f8637309f0f9840cc55b35ccd40732ad183fdc63593c3e63a","observation_id":"4a866159-e575-4a45-9ed7-802c1031900e","resolution":{"observed_at":"2026-08-12T05:00:58.238544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.221982Z","title":"Poste- rior sampling for competitive rl: Function approximation and partial observation","venue":null,"work_id":"51005925-e597-4316-8135-785de6576707","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.637547Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e9e688ee42d37cd01ead1c8e0d69f6d2ae99a3e740ed5bc524e0f2de83bdc7cb","observation_id":"cedc9884-654f-48df-a2a5-a4435ef11285","resolution":{"observed_at":"2026-08-12T05:00:58.226186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.209632Z","title":"Learning to communicate with deep multi-agent reinforcement learning","venue":null,"work_id":"eec66772-cdb6-48d3-9856-63d1d3a75691","year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.641729Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c06ccdc4f171436bd2076de45a5f28f670cafb69a60e9ae08f2f9c80dcd546cb","observation_id":"fa8a4d42-0c85-45f8-aa69-ebeebc845115","resolution":{"observed_at":"2026-08-12T05:00:58.213731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.197111Z","title":"Computationally efficient pac rl in pomdps with latent determinism and conditional embeddings","venue":null,"work_id":"24ce4f1e-7a9c-45bc-b70a-4a91a796934a","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.645575Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d5e49be734c759ae7d10b6e13fee81d39cb0b01dbe0b623d9dc6a8d44c359d91","observation_id":"2231e7d5-4078-439a-8c17-b7b62cfe3929","resolution":{"observed_at":"2026-08-12T05:00:58.201238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.182408Z","title":"Actor-critic algorithms","venue":null,"work_id":"feb6e833-fa51-43d5-b95f-613afaadd631","year":2000},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.649339Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:546fd2a7017edf2f82d4ad451174f9f9743b180f07a94322adc563080d42d9ca","observation_id":"e14c806f-8f65-42cf-9715-667326470196","resolution":{"observed_at":"2026-08-12T05:00:58.186967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.168813Z","title":"Provably e fficient exploration in policy optimization","venue":null,"work_id":"02e6305e-e598-469d-86cf-065e38c69967","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.653116Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:4e0c8177cef4c94ce58ad16076994d5c677e09b8b283364241c2bea6fe8c6b23","observation_id":"82d5fc1e-41a3-4ca6-8134-d17fa4c918e2","resolution":{"observed_at":"2026-08-12T05:00:58.173029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.155357Z","title":"Optimistic policy optimization with bandit feedback","venue":null,"work_id":"55717c1f-437f-476b-bc55-ed26fb1eb7c1","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.657114Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:53c6e791fbec7b391b96f1a5a64b847ae8a985442a0252528cb2106beb4d7537","observation_id":"31f7914a-92bf-4466-a3a6-50437b3e9e20","resolution":{"observed_at":"2026-08-12T05:00:58.159754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T05:00:57.660877Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.660877Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:51c6f76a1b660ed671e91e3a9ba8b617d508a7d4ef6484cf709e2ac52780fa00","observation_id":"c73b445d-dab2-4326-8fb5-54831e4d0d0f","resolution":{"observed_at":"2026-08-12T05:00:57.660877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.141416Z","title":"A natural policy gradient","venue":null,"work_id":"d79cc3a6-8eb6-40d6-87de-f91c266b7fc4","year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.664830Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7ac059b0ab6eb56735052125ee6c5362d94c2e4e8ea8a694c6fa6179659ad38a","observation_id":"4b321497-10f6-4430-a6b4-a709545abb65","resolution":{"observed_at":"2026-08-12T05:00:58.146247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.127660Z","title":"Optimality and approxi- mation with policy gradient methods in Markov decision processes","venue":null,"work_id":"2f6fe869-eedf-4f10-946d-2534cc82bbf6","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.668539Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:0902fec7e962344b49266ef9ce8511661e7c97899c8e1f48919d9bb391656f52","observation_id":"3c907966-e501-4a25-b882-e415f34b9484","resolution":{"observed_at":"2026-08-12T05:00:58.131943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.115227Z","title":"Information state embedding in partially observable cooperative multi-agent reinforcement learning","venue":null,"work_id":"364367a0-4c9c-4170-926c-d16e175319e0","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.672466Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:eca263bc6f143e89941e834245b6904c853b9ed74a6ba796bb707b604af36c1a","observation_id":"292cda01-7a8f-4ac7-a0f0-cfb0b2c95d91","resolution":{"observed_at":"2026-08-12T05:00:58.119280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.102506Z","title":"Approximate infor- mation state for approximate planning and reinforcement learning in partially observed sys- tems","venue":null,"work_id":"0f0330c9-5b17-4b6d-a055-de42f4a24f16","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.676320Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c122050f4685bd9567e2aa9213518157a554f51b7da3cc2ca37cfb17629a01aa","observation_id":"c95e5aa1-8890-4093-9d8c-740e3d16bc7e","resolution":{"observed_at":"2026-08-12T05:00:58.106613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.090004Z","title":"Stochastic games with one step delay sharing information pattern with application to power control","venue":null,"work_id":"0599ab54-5e4d-4040-b64f-901813844197","year":2009},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.680053Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:53a82f3ae118d559c687b303dfebecf5a50407937b392f7ef734e7cd3c4bbffb","observation_id":"c9bc6d5d-eefc-4818-be95-83c0487b7a49","resolution":{"observed_at":"2026-08-12T05:00:58.094199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.077548Z","title":"A mea- surement study of internet delay asymmetry","venue":null,"work_id":"e3d1a3b8-e279-4f75-83b8-053cf350b335","year":2008},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.683976Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5e6a9936ecca93e50ade2d010f39114cf9f4f674fb8be11001a894238c17ecbb","observation_id":"9e3bb496-8db5-4244-830e-f8d3f22febbf","resolution":{"observed_at":"2026-08-12T05:00:58.081640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.687754Z","title":"Repeated games with incomplete information","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.687754Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:039c2d3e82be86dafc84cd8531a4b6848363b086ad363809a579ec3c2da6f3f2","observation_id":"6d2cb1c1-a240-4700-9c95-5033cda07d6b","resolution":{"observed_at":"2026-08-12T05:00:57.687754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.056746Z","title":"Information theory: From coding to learning","venue":null,"work_id":"33a1d465-998a-44cc-8d6f-b24b8e362a97","year":2025},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.691607Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:a1ac943a53d9a43fdaa98204241a44b2b70f483e0cd8ba91ca2b10d85a0eb217","observation_id":"254b8c83-d1ab-4357-a907-d2f66ae616c0","resolution":{"observed_at":"2026-08-12T05:00:58.060933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13341","last_updated":"2020-06-01T03:28:44Z","snapshot_observed_at":"2026-08-14T16:23:25.645252Z","submitted_at":"2019-05-30T22:39:57Z","title":"On Value Functions and the Agent-Environment Boundary","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13341","snapshot_observed_at":"2026-08-12T05:00:57.695389Z","title":"On value functions and the agent-environment boundary","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.695389Z"},"links":{"cited_paper":"/paper/1905.13341","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:64835cd5d07373d29382f607f16160246277a57825a36de04bc222336408a271","observation_id":"67936a39-66f6-4d20-b77b-b4d56d62b14f","resolution":{"observed_at":"2026-08-12T05:00:57.695389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11457","last_updated":"2020-04-08T22:39:42Z","snapshot_observed_at":"2026-08-08T17:40:57.148833Z","submitted_at":"2020-02-25T06:14:59Z","title":"A short note on learning discrete distributions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11457","snapshot_observed_at":"2026-08-12T05:00:57.699272Z","title":"A short note on learning discrete distributions","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.699272Z"},"links":{"cited_paper":"/paper/2002.11457","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e6cc35f21b6fed67d42f06b79aee8dd687eb3c2ba062a3a1129e5dd00bcd1ec3","observation_id":"6c07b385-7de8-4e98-8727-ce3a58b94cd4","resolution":{"observed_at":"2026-08-12T05:00:57.699272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.044352Z","title":"A characteri- zation of multiclass learnability, 2022","venue":null,"work_id":"c956d6d6-bb41-4cf8-ac1a-d31f81742474","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.703594Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d155a509cdc0daba0d043a5906a0eb99ed37390fcd48fa4c1e093f5f6b712890","observation_id":"2580b214-3fde-481e-aa8e-d04beaee22e3","resolution":{"observed_at":"2026-08-12T05:00:58.048694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.031908Z","title":"A characteriza- tion of multiclass learnability","venue":null,"work_id":"b42c9381-6097-4d0e-a5c6-357e07888c3b","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.707289Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:874e9daa1762a61f240ba2bace6c7d146acba29e03661cd286f0baaf505e0715","observation_id":"cffa59e6-104b-47c8-99c6-0c4b76a227a0","resolution":{"observed_at":"2026-08-12T05:00:58.036051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.019336Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"b54496e6-a2b9-4baf-9825-0d0c046391e1","year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.711055Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d60c0d104c6de08ecd51758607f774ea35495df2230a28005943f98ad699def5","observation_id":"88707e5b-c738-43f6-a625-0f666337a471","resolution":{"observed_at":"2026-08-12T05:00:58.023529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.006319Z","title":"Convex optimization: Algorithms and complexity","venue":null,"work_id":"ba64a2af-d848-4fac-a442-019549463c0a","year":2015},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.714868Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e59ec459b0f28b0f5120884b06f1306be0eca5c4ac73c70c84ec9fa05c196afa","observation_id":"db7590f0-0b5f-43a8-81bb-880ea14462cf","resolution":{"observed_at":"2026-08-12T05:00:58.010854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.993657Z","title":"Tighter problem-dependent regret bounds in reinforce- ment learning without domain knowledge using value function bounds","venue":null,"work_id":"ed645aa9-dd67-499e-8c46-507b8443d093","year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.718762Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f25735d813ee8c55aefa566d57d924b4148b3bc89b5ba5eb1e5e2a75323c94c3","observation_id":"c550fa58-6a96-4029-9677-f99375c1814a","resolution":{"observed_at":"2026-08-12T05:00:57.997919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.980713Z","title":"Reward-free exploration for reinforcement learning","venue":null,"work_id":"dd54286d-61a6-47ab-b550-b8cdf56a18d5","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.722481Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5f135c2003dd422cee6b07442c27dc5aad2fb1b4ed0bc7ce2f789db010444a54","observation_id":"b84e87ff-29a4-42be-843a-e0b026fa63cb","resolution":{"observed_at":"2026-08-12T05:00:57.984880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.967019Z","title":"Is Q-learning provably efficient? In Advances in Neural Information Processing Systems, pages 4863–4873, 2018","venue":null,"work_id":"69ddc08f-c8b8-4176-b200-a64d87c6005d","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.726414Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:958b9494888705e572d7fb99011881b836134ed5b7ebe05aea8421bed87cdc0b","observation_id":"a754894a-2951-40e7-909b-970f2e2adf3b","resolution":{"observed_at":"2026-08-12T05:00:57.971151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.954412Z","title":"No-regret learning in convex games","venue":null,"work_id":"bf5e0c7a-448c-4a12-8aab-2edb417febc5","year":2008},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.730158Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5c462ba07640b2e2b3692157f90cd7f6dda4c684cb236c50d8b9556fc367400a","observation_id":"c3b66ef2-81f7-40af-ad94-b46acf6a31e8","resolution":{"observed_at":"2026-08-12T05:00:57.958482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.941592Z","title":"No-regret learning in bayesian games","venue":null,"work_id":"bb6c5738-4182-411f-82ed-011255e3150f","year":2015},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.734176Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f10d229d4fcec525cf5d238b090bf3f767a7159ef3dd3633fa5df52f9fb0328b","observation_id":"2822478c-8fe3-4201-995a-0bdb4b02f0e7","resolution":{"observed_at":"2026-08-12T05:00:57.945880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05005","last_updated":"2025-06-29T13:53:00Z","snapshot_observed_at":"2026-08-13T12:05:14.637455Z","submitted_at":"2023-04-11T06:22:51Z","title":"Bayes correlated equilibria, no-regret dynamics in Bayesian games, and the price of anarchy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05005","snapshot_observed_at":"2026-08-12T05:00:57.737884Z","title":"distilled","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.737884Z"},"links":{"cited_paper":"/paper/2304.05005","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:89e21a03b499cd6f4552aca0173a9338dec3ae0f38ffa007352c403d84959d5f","observation_id":"1b60dc6e-6f1f-43bb-bd5c-1f1a7e5e29ab","resolution":{"observed_at":"2026-08-12T05:00:57.737884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.928758Z","title":"By pluggingLt−1(π) into Equation (C.1), with simple algebric manipulations, we prove that: πt h(·|τh)∝πt−1 h (·|τh)exp ηEsh∼bh(τh) h Qt−1 h (τh,sh,·) i","venue":null,"work_id":"a54c020d-76f8-46b1-b96c-c05c622f21c6","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.742983Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e0b25aeb8752a2635754ff0f7056e4164ef1d9fe868fb62e94fea4c2aba2f77a","observation_id":"c3edf6af-5c31-413e-a19b-9db9d4b3320c","resolution":{"observed_at":"2026-08-12T05:00:57.933014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.915698Z","title":"bV (mi⋄πk i )⊙πk −i,G i,h+1 (ch+1) # ,H−h + 1 ) , where the last step is by inductive hypothesis. Now note that for anysh,ph,ah, we have bk−1 h (sh,ah) +Eoh+1∼bJk−1 h (·|sh,ah)","venue":null,"work_id":"fae1e440-59ff-4eb4-befd-70b940c1ebbc","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.747243Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:284b59a55ea51e928c00a37c8b29602f72baf8f61cb4748c0c23d3b3fa530df7","observation_id":"1032c0d1-fd32-4015-a79e-d617f6fb4d71","resolution":{"observed_at":"2026-08-12T05:00:57.920214Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T10:23:37.042875Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":67},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 1 inbound Pith citation observation for arXiv:2412.00985."}