{"as_of":"2026-08-10T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dd981b66b228a80da98c37c676cfd5ce9dea698022c786630991a80ee15face","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:05:26.101533Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00795/citation-record","integrity":"/paper/2506.00795/integrity","json":"/paper/2506.00795/citation-record.json","paper":"/paper/2506.00795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.717787Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.717787Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:86d82ed7bcfb1de0a86350496b2c4e4ed78ed5e8cb6547fc42a276e09d8ab842","observation_id":"ac9d45cc-7a9f-41d9-b013-0c0be567dee7","resolution":{"observed_at":"2026-08-07T12:05:25.717787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.723026Z","title":"On the estimation of production frontiers: maximum likelihood estimation of the parameters of a discontinuous density function","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.723026Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:462ac4b81ef6cf12598991ac6a7e09a8b4ab4467957aefb2e6faea1c2f1a19a8","observation_id":"0c629fa2-b676-4ebf-a403-7d3f06ebde26","resolution":{"observed_at":"2026-08-07T12:05:25.723026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.728070Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.728070Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0e3c8d41adea8011cb6e3b8831434df191aa113570a9fc0d640b8a8016caae61","observation_id":"a6022746-c35d-493e-ab30-e9d86c9fab73","resolution":{"observed_at":"2026-08-07T12:05:25.728070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07123","last_updated":"2021-01-18T15:33:26Z","snapshot_observed_at":"2026-08-09T14:57:50.184993Z","submitted_at":"2021-01-18T15:33:26Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07123","snapshot_observed_at":"2026-08-07T12:05:25.733026Z","title":"Learning successor states and goal-dependent values: A mathematical viewpoint","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.733026Z"},"links":{"cited_paper":"/paper/2101.07123","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1bae6cb4549d35a97dbd67da3f0319744db91b23d374b607b1d2f637dbae4694","observation_id":"0eec7250-8f73-4841-8163-0584315efc57","resolution":{"observed_at":"2026-08-07T12:05:25.733026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.119767Z","title":"Accelerating goal-conditioned reinforcement learning algorithms and research","venue":null,"work_id":"85467bdb-d89c-4281-b6e3-a870037fffc4","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.737574Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:2502f80cf032916a5d5e293f4a56c3e2cde767272c03f688a29d4f14541becf7","observation_id":"d0775145-8232-416d-ad3c-985501eafa1c","resolution":{"observed_at":"2026-08-07T12:05:27.123474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.742340Z","title":"Offline rl without off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.742340Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5fb4370ffd99df97c24d758e9b6f6b084a5f181c594e3bc18af65cc0a4c304e3","observation_id":"fb9f4169-e126-4d26-8760-662962c2a265","resolution":{"observed_at":"2026-08-07T12:05:25.742340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.096505Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? Advances in Neural Information Processing Systems, 35: 0 1542--1553, 2022","venue":null,"work_id":"b9b3f6da-d3f0-43b7-b40a-71a0366d6b95","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.747851Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:068981f60652840ca2ee7ed4ffd40bb1c5af3fe059e07948c62e1fe55413fea2","observation_id":"dc72a2a9-7eda-4695-8aeb-59ff29e0fce6","resolution":{"observed_at":"2026-08-07T12:05:27.100466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02013","last_updated":"2024-09-11T10:48:49Z","snapshot_observed_at":"2026-08-07T05:19:28.648698Z","submitted_at":"2024-06-04T06:49:18Z","title":"Mamba as Decision Maker: Exploring Multi-scale Sequence Modeling in Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02013","snapshot_observed_at":"2026-08-07T12:05:25.752674Z","title":"Mamba as decision maker: Exploring multi-scale sequence modeling in offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.752674Z"},"links":{"cited_paper":"/paper/2406.02013","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5eadd1b0df76f7a804bdd4fef1523740cfc1b796a6173afd03788cc6c681dbb5","observation_id":"1900dc52-3d95-4889-bea5-aa5ba811b9a9","resolution":{"observed_at":"2026-08-07T12:05:25.752674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.085338Z","title":"Goal-conditioned reinforcement learning with imagined subgoals","venue":null,"work_id":"ab3cfe17-075f-42f8-9cc7-6121d36721ee","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.757238Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5e0f78cadd150d9f52f9c3061dba40fb776e48b83a6ee59dd8bd35a2ede0767f","observation_id":"da09bc93-76e4-4615-9e8e-9c8fe5094a62","resolution":{"observed_at":"2026-08-07T12:05:27.088998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.069937Z","title":"On the statistical benefits of temporal difference learning","venue":null,"work_id":"859e3907-f92a-4084-b9b6-34f92ac505d1","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.761572Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:57ed5d9f79675bde58d7883e60017ca6e09f5dc5e5717f47be26bf9e1b78fc37","observation_id":"d46ca468-7388-4700-9cb4-81b704157246","resolution":{"observed_at":"2026-08-07T12:05:27.073974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.766013Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.766013Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:90f7d6386db5e843973f109db2654e4b349b04bd9454688ecb03ea07901cf3f4","observation_id":"05f055f6-a886-4d96-9ed4-26e1783a705a","resolution":{"observed_at":"2026-08-07T12:05:25.766013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.770153Z","title":"Goal-conditioned imitation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.770153Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:cf898daa2eb609ddfe28131fb92a742b5223a5f1c88582ac7397faa0d9f86d60","observation_id":"40ee4e50-4a6d-48ab-a17f-d624539b2950","resolution":{"observed_at":"2026-08-07T12:05:25.770153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10751","last_updated":"2022-05-11T03:17:44Z","snapshot_observed_at":"2026-08-09T16:07:52.623918Z","submitted_at":"2021-12-20T18:55:16Z","title":"RvS: What is Essential for Offline RL via Supervised Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10751","snapshot_observed_at":"2026-08-07T12:05:25.775369Z","title":"Rvs: What is essential for offline rl via supervised learning? arXiv preprint arXiv:2112.10751, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.775369Z"},"links":{"cited_paper":"/paper/2112.10751","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1236d69cc387aa7ef640915d85ef2aca64ab15a1a4951f22974a3e0dda03854d","observation_id":"b26c610a-459b-44af-9acb-69a25dc55670","resolution":{"observed_at":"2026-08-07T12:05:25.775369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08909","last_updated":"2021-04-19T18:33:47Z","snapshot_observed_at":"2026-08-08T15:56:27.804944Z","submitted_at":"2020-11-17T19:58:56Z","title":"C-Learning: Learning to Achieve Goals via Recursive Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.08909","snapshot_observed_at":"2026-08-07T12:05:25.785189Z","title":"C-learning: Learning to achieve goals via recursive classification","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.785189Z"},"links":{"cited_paper":"/paper/2011.08909","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3b8d4dea5cd937cb3c0de35f85aedc4234cce51997c6f79ea97a85842e98d513","observation_id":"bbad15d8-706f-4444-9661-dcec1aa5946d","resolution":{"observed_at":"2026-08-07T12:05:25.785189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.036546Z","title":"Imitating past successes can be very suboptimal","venue":null,"work_id":"99d412a4-f2c9-4b9e-b5f5-2de7cb3d76c8","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.797884Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ce073162c4b9052fdeb617d288277e96e6e68334595e7bde79db72c6d17c096b","observation_id":"6ffaf888-2f16-4a8a-8ffd-9d2ed56273b1","resolution":{"observed_at":"2026-08-07T12:05:27.041974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.022741Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"132aea29-bd78-4b79-9b9f-4f20141695e3","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.806254Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e48a52befcff97dfcf1a0c8bb4a4d5d9b1781575ac6c81c8d1d4c44373d851b1","observation_id":"1b94d514-e345-483e-ab0f-72493bc2707a","resolution":{"observed_at":"2026-08-07T12:05:27.026589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.005654Z","title":"Inference via interpolation: Contrastive representations provably enable planning and inference","venue":null,"work_id":"0010d16d-76ab-434f-a0fb-bd48d330e6a1","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.812950Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e42acc4cb86044104e8308b6c66272d73f8930ef3ef6e0de75151b691bc9d526","observation_id":"8408698a-ec22-445f-8d72-8d4e4f62cfc2","resolution":{"observed_at":"2026-08-07T12:05:27.009713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:05:25.820597Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.820597Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:86f35efe837ef7b2b02514d6677b2d4a3e3b59b6e67a35f4b34b9afa52e7d6f4","observation_id":"4e9db73b-ece7-43c6-9a15-e5a3a1b6028b","resolution":{"observed_at":"2026-08-07T12:05:25.820597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.828824Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.828824Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3bbe1d661183fb2b29f09fadaceb4a02312b2cdcfff7e99065754be6385612b6","observation_id":"6833a941-aa87-4b87-b910-42a1c54cfb00","resolution":{"observed_at":"2026-08-07T12:05:25.828824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.981939Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":"25e51bcc-a357-454c-bbba-50a58ec07be2","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.836914Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:2b2e61ea42a24f2e083370bb3b9c1716fc40601828001635f4592adbe09dcf49","observation_id":"68403ab2-45bf-4103-8b10-8bdc7ef7f3bc","resolution":{"observed_at":"2026-08-07T12:05:26.986664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.968932Z","title":"Closing the gap between TD learning and supervised learning - a generalisation point of view","venue":null,"work_id":"a5f16acc-4b61-4dfd-9576-6098e952b343","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.845241Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:768da47ae208233dd6f545b4dd649d1c14cafb546dae5c3e758f9881b478c38d","observation_id":"2e8b731c-3160-440d-9f66-c4cc18ed1276","resolution":{"observed_at":"2026-08-07T12:05:26.973047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13774","last_updated":"2023-04-26T18:35:49Z","snapshot_observed_at":"2026-07-06T15:20:29.154658Z","submitted_at":"2023-04-26T18:35:49Z","title":"Distance Weighted Supervised Learning for Offline Interaction Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13774","snapshot_observed_at":"2026-08-07T12:05:25.851471Z","title":"Distance weighted supervised learning for offline interaction data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.851471Z"},"links":{"cited_paper":"/paper/2304.13774","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:442947647e5848d48e1345ee95f31013d781f55c9cd404f8561180e47e43939c","observation_id":"36e41fa6-edff-4f22-af06-65760ef38fe7","resolution":{"observed_at":"2026-08-07T12:05:25.851471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.956585Z","title":"Diffused task-agnostic milestone planner","venue":null,"work_id":"a1325c06-7c50-409d-b9ff-207c6b808c1c","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.856909Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0181c6ed5f46352cc8b2b7a63ce144c3201be181f8c065b15b66b7b3319b963a","observation_id":"f7e355dd-8db1-498a-bbed-21c4b1f7bf24","resolution":{"observed_at":"2026-08-07T12:05:26.960312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00079","last_updated":"2024-05-31T10:41:03Z","snapshot_observed_at":"2026-07-06T18:23:31.520359Z","submitted_at":"2024-05-31T10:41:03Z","title":"Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling","version":1},"cited_work":{"arxiv_id":"2406.00079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00079","snapshot_observed_at":"2026-08-07T12:05:26.388725Z","title":"Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling","venue":"cs.LG","work_id":"c3e60013-ef6d-44e2-8ff7-6539974042f9","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.860929Z"},"links":{"cited_paper":"/paper/2406.00079","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4f1dd4b57512d35e96b469ac99cea7382ff68329955e2e0cb51aee90ade0ca9a","observation_id":"77b97c48-a143-4bf1-abcd-26486fc6b117","resolution":{"observed_at":"2026-08-07T12:05:26.394932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.946265Z","title":"Learning to reach goals via diffusion","venue":null,"work_id":"267c4da0-6226-4fca-b258-1c6fa8f5abee","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.865082Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:17a2b8d4fc123794603397f9c6f54fb023d6697f78bdcdce5e77abaa905706a9","observation_id":"d2b47e03-40b7-4d65-91e9-1887d2c8aa79","resolution":{"observed_at":"2026-08-07T12:05:26.949447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.934748Z","title":"Efficient planning in a compact latent action space","venue":null,"work_id":"e318ce54-0dab-4260-9dff-243e1ec39760","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.869691Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:fbfe66cdef5ab078fae771892969000c8ebd0cde1c313c856bdc99c2d9398919","observation_id":"95e9d632-ee99-466d-abfc-0287ee48a294","resolution":{"observed_at":"2026-08-07T12:05:26.938587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.924362Z","title":"Adaptive q -aid for conditional supervised learning in offline reinforcement learning","venue":null,"work_id":"d841c4a7-c0f2-4d37-9915-c7704462db6a","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.874197Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a4b0db325fa38b2fba1f3a86e10c55dda8b212eebbef37516155b40e6e1051b2","observation_id":"333012e5-a28a-43fa-9fbd-f51f78732e31","resolution":{"observed_at":"2026-08-07T12:05:26.927879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11166","last_updated":"2023-03-20T14:51:10Z","snapshot_observed_at":"2026-08-09T14:33:03.393624Z","submitted_at":"2023-03-20T14:51:10Z","title":"Imitating Graph-Based Planning with Goal-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11166","snapshot_observed_at":"2026-08-07T12:05:25.878623Z","title":"Imitating graph-based planning with goal-conditioned policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.878623Z"},"links":{"cited_paper":"/paper/2303.11166","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:141d905eb082f2f416ae8760922b2a90fc5ec02fb8f5473b9fab590163053f69","observation_id":"7cb756c9-6bfd-4cd5-993b-d1ddc942d258","resolution":{"observed_at":"2026-08-07T12:05:25.878623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.912762Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"3c0322b3-5495-416a-8a9a-63848af2bee0","year":2014},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.883186Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3e7d40bee1d17cf3d869c6b95b16d7b4741e9487883b2f14dc502056514ada69","observation_id":"991722db-63c3-41eb-83da-9416adc5569c","resolution":{"observed_at":"2026-08-07T12:05:26.916192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02691","last_updated":"2019-12-11T17:33:13Z","snapshot_observed_at":"2026-07-06T07:58:30.747165Z","submitted_at":"2019-06-06T16:35:38Z","title":"An Introduction to Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02691","snapshot_observed_at":"2026-08-07T12:05:25.887182Z","title":"An introduction to variational autoencoders","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.887182Z"},"links":{"cited_paper":"/paper/1906.02691","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5bb8bc3f529b7ee07572dbfef7a6c5112846ab6edfa2fa48f8bc76fe0036c753","observation_id":"3f22aaa2-4fed-44ab-a087-56d7c8e1c94a","resolution":{"observed_at":"2026-08-07T12:05:25.887182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:05:25.890730Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.890730Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:64ff3a2f7350f0f8e9300a3c21a35977ca910c00c9eab5469b77ae38dc19b747","observation_id":"0d1a09a9-e890-4949-a7ad-ce801bfbbe15","resolution":{"observed_at":"2026-08-07T12:05:25.890730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.894463Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.894463Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:d729063fdf865a020ed548e47a4c9c96ed2400a798a4654624979837f1b5f82e","observation_id":"6cac748e-1609-4fa2-8267-547de17c0893","resolution":{"observed_at":"2026-08-07T12:05:25.894463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.898096Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.898096Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:6dcb5193543c268d299bd50a97d8ccbd949aa06e6337f389e6444c27d712f7bc","observation_id":"e129b63b-db0d-4810-b0ba-659543a77553","resolution":{"observed_at":"2026-08-07T12:05:25.898096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.886183Z","title":"Multi-game decision transformers","venue":null,"work_id":"fad5a611-3a6b-4d3e-86ec-931922b74d1f","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.901393Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0d6f5f845a9384f77441e3cee03608548e3a5d39bf9022fc4d4739c7e49a76f1","observation_id":"298c4dee-8b0d-474e-afad-c57e481b4223","resolution":{"observed_at":"2026-08-07T12:05:26.890075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.874031Z","title":"Dhrl: a graph-based approach for long-horizon and sparse hierarchical reinforcement learning","venue":null,"work_id":"5f279d45-5e6a-41e5-8264-e4bbb71633b4","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.904989Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:27478b18a62b98e78e41dfb27d9aaadb975f1b30aad8c679b0106992167627a0","observation_id":"4da2b345-5e0d-4d95-a039-aed07cae0242","resolution":{"observed_at":"2026-08-07T12:05:26.877877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T12:05:25.909047Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.909047Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:959ca39ebbb5b04fda58ad227b2fbe5b9f8f50a4ffb901d795bb261f414e9929","observation_id":"d0173034-cc60-47ef-acb7-cf86d44b445c","resolution":{"observed_at":"2026-08-07T12:05:25.909047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.859975Z","title":"Hierarchical planning through goal-conditioned offline reinforcement learning","venue":null,"work_id":"ce63ed17-c057-4444-b990-3c63e123c6a7","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.912606Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:48bec0b1721b2949ef06dfaa6450f977d3e4fd43f975c4c7d4802d082831fb11","observation_id":"338ffa32-a5ea-4dcf-8a0d-aae0f181c06a","resolution":{"observed_at":"2026-08-07T12:05:26.865153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14790","last_updated":"2024-05-23T17:00:15Z","snapshot_observed_at":"2026-07-06T18:18:47.640933Z","submitted_at":"2024-05-23T17:00:15Z","title":"DIDI: Diffusion-Guided Diversity for Offline Behavioral Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14790","snapshot_observed_at":"2026-08-07T12:05:25.916444Z","title":"Didi: diffusion-guided diversity for offline behavioral generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.916444Z"},"links":{"cited_paper":"/paper/2405.14790","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:915275f2920b1b736081ab3734fb392cbf783f2c52038cb72ab3daafd2490571","observation_id":"2b3f252c-1f37-403b-ba3f-b2186e6ef988","resolution":{"observed_at":"2026-08-07T12:05:25.916444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.846225Z","title":"Beyond ood state actions: Supported cross-domain offline reinforcement learning","venue":null,"work_id":"88df59cd-5b0d-4517-bb57-e5104daa912a","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.920305Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:9511a072074af5fa4f0e58141750a4f43c3bd8e7dc27126ace469673acb88bd2","observation_id":"ab0ce511-34ba-4e69-b886-0908976a8819","resolution":{"observed_at":"2026-08-07T12:05:26.850298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.924152Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.924152Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:f0937a119f64cd027c6eba9938ae023fd60302b0dcb68b95d326474afc5b8111","observation_id":"d1625f51-008d-47f1-a75b-80e9ec423a6f","resolution":{"observed_at":"2026-08-07T12:05:25.924152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:05:25.928161Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.928161Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e3391f7fe453f70d24b3f70b1eab487e0833d5c2a5d924a3dcc09d2ae4977bd6","observation_id":"05f6f010-fa26-43cc-9226-12825383213b","resolution":{"observed_at":"2026-08-07T12:05:25.928161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05153","last_updated":"2025-05-05T16:26:30Z","snapshot_observed_at":"2026-08-07T17:22:58.699191Z","submitted_at":"2025-03-07T05:22:52Z","title":"Generative Trajectory Stitching through Diffusion Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05153","snapshot_observed_at":"2026-08-07T12:05:25.931670Z","title":"Generative trajectory stitching through diffusion composition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.931670Z"},"links":{"cited_paper":"/paper/2503.05153","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:fae7d49905f0c527332cc7ee0dbed7d9fde645c24124b4cbe2d89d4a83d331f0","observation_id":"2a9bff04-ecfd-42a1-be87-47952d4c0d07","resolution":{"observed_at":"2026-08-07T12:05:25.931670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.819554Z","title":"Decision mamba: A multi-grained state space model with self-evolution regularization for offline rl","venue":null,"work_id":"13ecea6d-1214-4ec6-9fe1-64169a29c6fa","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.936092Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a06b7c8de24484d3d232b5478b77148deb383b4ab1279ce85ebb4513d1ba4adc","observation_id":"0ee3c592-d739-4461-ae0c-81d25979e657","resolution":{"observed_at":"2026-08-07T12:05:26.823899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.802688Z","title":"Learning latent plans from play","venue":null,"work_id":"33f42e99-1e2b-4322-81f7-f2f8b0618300","year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.939663Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:2c634570b16fefed929e4b4898b4b33968a6c0aac865918dafde1d3ac45f0e54","observation_id":"9161b203-157a-43c2-a75a-e6c58b3bf523","resolution":{"observed_at":"2026-08-07T12:05:26.807672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03023","last_updated":"2022-11-10T05:13:14Z","snapshot_observed_at":"2026-08-04T16:14:02.245796Z","submitted_at":"2022-06-07T05:40:16Z","title":"How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03023","snapshot_observed_at":"2026-08-07T12:05:25.943342Z","title":"How far i'll go: Offline goal-conditioned reinforcement learning via f -advantage regression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.943342Z"},"links":{"cited_paper":"/paper/2206.03023","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0c1e1762d81b4b1b58d22b0b651c4c0bdb0877fb54977a053365313077cc1f5d","observation_id":"7760b84f-ef4a-4c07-b158-dd9ed90e7346","resolution":{"observed_at":"2026-08-07T12:05:25.943342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.780255Z","title":"VIP : Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":"63886fa1-7bb8-4d6a-8dca-2c5ab5e97a5e","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.947029Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ac5cc4276e15da186e8f69a5b38f7e823fe7fd8476c374b1ca7b557d9be88c5b","observation_id":"c121fe31-7789-4cdd-bd85-6da077e82bd2","resolution":{"observed_at":"2026-08-07T12:05:26.787378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.950640Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.950640Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:013a198e6221c3e85c0bf442e6842b2c3d1f0111372090900bc7d5da5de6bacd","observation_id":"81535569-6821-4cf1-b589-a68adfbf95cf","resolution":{"observed_at":"2026-08-07T12:05:25.950640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-08-07T12:05:25.954383Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.954383Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0e0c55d4a68f0fd26dfd7ad69aac9337c92a53335b2a7713df1602930cc91a28","observation_id":"b836f8df-5d17-418a-9393-f6a1a8ccaa13","resolution":{"observed_at":"2026-08-07T12:05:25.954383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.759285Z","title":"Asymmetric least squares estimation and testing","venue":null,"work_id":"a0c6e36d-13e5-44fd-8ff6-c5ae99e61fc0","year":1987},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.958453Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1defa2ba44928448cf221a2c9f1e71aa942e6cb0f0cc346e99e6b5acd789f49f","observation_id":"d110249c-705f-4d70-a3d4-ceec22004d39","resolution":{"observed_at":"2026-08-07T12:05:26.763153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19925","last_updated":"2024-03-29T02:25:55Z","snapshot_observed_at":"2026-08-10T10:00:14.020801Z","submitted_at":"2024-03-29T02:25:55Z","title":"Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19925","snapshot_observed_at":"2026-08-07T12:05:25.961759Z","title":"Decision mamba: Reinforcement learning via sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.961759Z"},"links":{"cited_paper":"/paper/2403.19925","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a333f6787ff4a821669070e7dad25c4e9bf99578333701c5d3f52c8ffc5b22d0","observation_id":"6fff31ef-0216-4c08-a905-3cc793992213","resolution":{"observed_at":"2026-08-07T12:05:25.961759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.966571Z","title":"Hiql: Offline goal-conditioned rl with latent states as actions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.966571Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:15e571019e39874791ec7ce8d18a804e0756fdc0b540ee70f9b4fc6d89d90aea","observation_id":"49179c0b-5541-4a55-b2de-51de3d7635b3","resolution":{"observed_at":"2026-08-07T12:05:25.966571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15567","last_updated":"2024-05-26T17:44:52Z","snapshot_observed_at":"2026-08-07T05:14:40.258185Z","submitted_at":"2024-02-23T19:09:10Z","title":"Foundation Policies with Hilbert Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15567","snapshot_observed_at":"2026-08-07T12:05:25.970149Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.970149Z"},"links":{"cited_paper":"/paper/2402.15567","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:db547df0d02795151a22a2827bd5665ba49234065a9a4a974576ffa6f9f30278","observation_id":"f5f5575a-0a9d-432b-9163-2d9147e6f3df","resolution":{"observed_at":"2026-08-07T12:05:25.970149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.736095Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":"4c96bb35-eec2-4f22-a5cf-434bc39971cc","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.975726Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:d00e35b33f010feab74776517f6522785f49ed2fbac0aa2c3a0535472950a8ca","observation_id":"0b6d3909-af36-4f36-b8d2-07deef469bd8","resolution":{"observed_at":"2026-08-07T12:05:26.739722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.723683Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems","venue":null,"work_id":"b03b8de9-28b8-42d3-96c5-43791a592071","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.980393Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4ae971e645d9d7cf2f63c41ab8b58bbac9a80e540c1fb552137c15f0568ade24","observation_id":"03cde593-9e7a-4b38-b8c0-d2b09ffe2fe9","resolution":{"observed_at":"2026-08-07T12:05:26.727985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02532","last_updated":"2023-06-01T15:18:21Z","snapshot_observed_at":"2026-08-09T11:49:04.134824Z","submitted_at":"2023-04-05T15:52:34Z","title":"Goal-Conditioned Imitation Learning using Score-based Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02532","snapshot_observed_at":"2026-08-07T12:05:25.984273Z","title":"Goal-conditioned imitation learning using score-based diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.984273Z"},"links":{"cited_paper":"/paper/2304.02532","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a2f96df92e22655b83833aef80dc2967d678efac7bc87df894961f6a6f65c77b","observation_id":"738e246b-af48-488e-bd3d-3f9c6928ce3d","resolution":{"observed_at":"2026-08-07T12:05:25.984273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.711961Z","title":"Stochastic backpropagation and approximate inference in deep generative models","venue":null,"work_id":"16ce6d24-e3af-413f-b1cd-d66694fab7a2","year":2014},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.988205Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:228b3d472af7ea6e5457782c378689ccb7558b66bcfa98c2807e509b90b7d570","observation_id":"0047489f-1d2b-4ace-91ba-3d824f4a0da4","resolution":{"observed_at":"2026-08-07T12:05:26.716004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.700656Z","title":"Outcome-driven reinforcement learning via variational inference","venue":null,"work_id":"b37701b8-e042-489c-822f-99b980258ccb","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.994354Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:d70b39eba1cee3c2c9297f9f4e3299161ca24777eba0187c54b6cc8916500060","observation_id":"f43cd76c-e99b-47ef-a3bc-6bd55c4b6680","resolution":{"observed_at":"2026-08-07T12:05:26.704287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.688936Z","title":"Reinforcement learning upside down: Don't predict rewards -- just map them to actions, 2020","venue":null,"work_id":"a7ec01d7-10e6-496a-818a-1cfbe9ec7e7c","year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.998229Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:717414f01260282b443a7cfc83f6745663f7d2fcac1370c566d1500c51c1b588","observation_id":"5d75398f-09e4-484f-a1a0-d8b10e8421f6","resolution":{"observed_at":"2026-08-07T12:05:26.692774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.678296Z","title":"Rapid exploration for open-world navigation with latent goal models","venue":null,"work_id":"b563bb7a-e9d9-4fde-aaa8-4789b6980b2a","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.002289Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4e3658a76b1a8a24f2005d4d8e6d3beb613e79c3e3faa6a75cb6c24d757dd937","observation_id":"a0ad97e9-02cb-4edd-8211-cb21fa4dab4d","resolution":{"observed_at":"2026-08-07T12:05:26.681724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.667176Z","title":"Score models for offline goal-conditioned reinforcement learning","venue":null,"work_id":"d43a280d-841d-44d2-8040-83b051c16715","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.006634Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ac6cba887abb5a13132f5eaeb52f64acd4d1791f0a9b7ab9090b1fabefad23a8","observation_id":"dfc8bf9e-530b-400e-a12c-6bd0d5fc4e6f","resolution":{"observed_at":"2026-08-07T12:05:26.670794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.656566Z","title":"Geoadditive expectile regression","venue":null,"work_id":"ce8dc6ce-6597-4ce7-b74f-724684f24ae1","year":2012},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.010660Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3fddb9b316980a8d38f3f03e8f2cba4da6dd572d2d53a9c8e16a231873c266ac","observation_id":"a9e70b2b-72cf-44f6-996f-cfd0632dad84","resolution":{"observed_at":"2026-08-07T12:05:26.659954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.014377Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.014377Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:71fb1e733ed2ebb50f0109502e1555f986391785c5e73ea34af3b397bbb1c474","observation_id":"d9c00165-7d4f-4aeb-9178-49005ea0b73e","resolution":{"observed_at":"2026-08-07T12:05:26.014377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.636231Z","title":"Gymnasium (mar 2023), 2023","venue":null,"work_id":"fb136bfb-0aaa-4501-9a33-54ba98825d0e","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.018409Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:63b2a728cf41481de0e010e338bd08c67adefad7ec8ce8bda4c006b45e08f241","observation_id":"31cf407e-cc0a-4685-ae51-73d4d982f234","resolution":{"observed_at":"2026-08-07T12:05:26.639864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-10T12:35:10.713462Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-07T12:05:26.022196Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.022196Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:14316b30e3f8b184713f1e7a06a9e8cf5460bedafe4fb8ef74b86744289b1475","observation_id":"15c15ca4-5ecf-46a0-abb1-078650721ce1","resolution":{"observed_at":"2026-08-07T12:05:26.022196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.026210Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.026210Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:7a37f09a8de21b499c34cbb564902cebcd4f78b9a237a27ba9d40e7285a01ece","observation_id":"7e47b5a1-f2c6-4aec-b59c-e20c712aadcc","resolution":{"observed_at":"2026-08-07T12:05:26.026210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.615409Z","title":"GOP lan: Goal-conditioned offline reinforcement learning by planning with learned models","venue":null,"work_id":"46ec059b-bc9d-44f1-b0b4-8b8f6fb646bd","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.029722Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1dd1b26113e3c969a800dea806a5f207d1eaac5eec9fac542483736f2d3488bf","observation_id":"c20b3ea7-d6cd-4f80-a058-c02026c8f25b","resolution":{"observed_at":"2026-08-07T12:05:26.619349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.604221Z","title":"Optimal goal-reaching reinforcement learning via quasimetric learning","venue":null,"work_id":"5fbe7a21-ff73-4707-ae89-8afd4596b7dd","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.033672Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:9e006c34b856445660f52079d20ee40b50aa7c80d176ff477b532655f55b6e61","observation_id":"34fa6ff0-f0f9-4b0f-bac5-f5c5f9efce2b","resolution":{"observed_at":"2026-08-07T12:05:26.607776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.592556Z","title":"Critic-guided decision transformer for offline reinforcement learning","venue":null,"work_id":"26c1e7e1-7c28-4d60-8de1-65f732a2891f","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.038097Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:001777a92803841e7770f712bf9b8a4f645cd0cdafd57c51280c7c7802951b43","observation_id":"4064caf9-0460-452a-a414-d3ea921924ee","resolution":{"observed_at":"2026-08-07T12:05:26.596625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.581099Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"6dd68412-213d-46cd-9615-3d179954f11c","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.041485Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1f4f5e7dc655b222094f06cf16067966b02d0ed2faf501e26d37f73a41a9cfe8","observation_id":"1f240bd1-3f82-44a7-900f-bb0dcb6eb6ec","resolution":{"observed_at":"2026-08-07T12:05:26.584880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02484","last_updated":"2023-10-20T05:12:04Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T17:58:21Z","title":"Elastic Decision Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02484","snapshot_observed_at":"2026-08-07T12:05:26.045615Z","title":"Elastic decision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.045615Z"},"links":{"cited_paper":"/paper/2307.02484","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:52a2aa8df670e6fbde8cece8b58ae2c1efcb339a969e808279fdcefac331ed52","observation_id":"e8e42e3d-1cdb-42c8-9228-c14463d124a2","resolution":{"observed_at":"2026-08-07T12:05:26.045615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.569740Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"93aafaaa-0ca0-48cb-8c4d-38e5672cb6d0","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.050121Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:eb7961863209aa2f74681e4528997a285ca9eeb5d2b1ea16211fd971b853faf4","observation_id":"ca8c62b3-2b08-4809-9704-568102ecae9d","resolution":{"observed_at":"2026-08-07T12:05:26.573852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04478","last_updated":"2022-02-14T04:26:50Z","snapshot_observed_at":"2026-08-08T23:10:28.615456Z","submitted_at":"2022-02-09T14:17:05Z","title":"Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04478","snapshot_observed_at":"2026-08-07T12:05:26.054551Z","title":"Rethinking goal-conditioned supervised learning and its connection to offline rl","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.054551Z"},"links":{"cited_paper":"/paper/2202.04478","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:04572f55e0449ae0b9b99687e78770db4c0966931b5297cb458ceb766edf89e2","observation_id":"158ff2de-8365-47d0-809c-dfad1cc405e2","resolution":{"observed_at":"2026-08-07T12:05:26.054551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.557148Z","title":"What is essential for unseen goal generalization of offline goal-conditioned rl? In International Conference on Machine Learning, pages 39543--39571","venue":null,"work_id":"b3b95ff6-5e32-41c3-b5d8-6141a168476f","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.058489Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3301d8e203982315876bb74e8b1eaca8fe3032294f097732c95ac9297d40b33d","observation_id":"db0fa5c6-5581-4b25-87fb-013fcef04677","resolution":{"observed_at":"2026-08-07T12:05:26.561418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08865","last_updated":"2023-02-17T13:22:40Z","snapshot_observed_at":"2026-08-09T17:27:13.769728Z","submitted_at":"2023-02-17T13:22:40Z","title":"Swapped goal-conditioned offline reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08865","snapshot_observed_at":"2026-08-07T12:05:26.062222Z","title":"a m \\\"a r \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.062222Z"},"links":{"cited_paper":"/paper/2302.08865","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:bb6fe448aa0401e4f5d5362b8c897a1ec7ab59391a2ea5ab053085778a53b470","observation_id":"77db9b91-9fca-46a6-9296-56fca0933486","resolution":{"observed_at":"2026-08-07T12:05:26.062222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.066117Z","title":"Breadth-first exploration on adaptive grid for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.066117Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4af63ea8f4544687df13a507774cfd8f381fed6e8a8d794fe74dae6c4632ce30","observation_id":"2f8dd9a5-e9c1-4d76-af4a-b181000ab2fb","resolution":{"observed_at":"2026-08-07T12:05:26.066117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.535014Z","title":"Goal-conditioned predictive coding for offline reinforcement learning","venue":null,"work_id":"8a51587f-fa5d-462a-b535-6162d34b1bf3","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.069683Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:8f78534f93e9014de9d0bf5451167c749ea970ea31dca8c633e2788574ba9cf6","observation_id":"7fbcd7cd-bb20-4774-be4e-c2841fc8cbee","resolution":{"observed_at":"2026-08-07T12:05:26.539901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03346","last_updated":"2025-06-10T04:54:06Z","snapshot_observed_at":"2026-07-06T15:38:58.578200Z","submitted_at":"2023-06-06T01:36:56Z","title":"Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03346","snapshot_observed_at":"2026-08-07T12:05:26.072975Z","title":"Stabilizing contrastive rl: Techniques for offline goal reaching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.072975Z"},"links":{"cited_paper":"/paper/2306.03346","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a6ed17abd7d82913cf5bcd87c97461029a91d28220ffc48ead7df2218521fda2","observation_id":"b155832e-295f-432b-bfcd-1de1323f54b8","resolution":{"observed_at":"2026-08-07T12:05:26.072975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.522331Z","title":"Contrastive difference predictive coding","venue":null,"work_id":"afa3088f-bd42-46e2-9b14-ac82ca450e0f","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.076893Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:f5a05294b04c867b8a0a10207b3f7a8252c78cf57f46309610ba269d873ff5c4","observation_id":"1b355547-cf41-4fd4-860b-354833c8961b","resolution":{"observed_at":"2026-08-07T12:05:26.526281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.510099Z","title":"Online decision transformer","venue":null,"work_id":"a40c3f29-1490-44b4-b497-da07c394af80","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.081476Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:64b9c59ac21a242daaf1f61a8885b670566b7f342b4014d6d8455c5c668c0b5f","observation_id":"1007d93e-a759-4670-a9ae-ce0f34545b99","resolution":{"observed_at":"2026-08-07T12:05:26.514001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11312","last_updated":"2023-02-22T11:49:12Z","snapshot_observed_at":"2026-08-04T08:55:37.127470Z","submitted_at":"2023-02-22T11:49:12Z","title":"Behavior Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11312","snapshot_observed_at":"2026-08-07T12:05:26.085023Z","title":"Behavior proximal policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.085023Z"},"links":{"cited_paper":"/paper/2302.11312","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:2d147d51e4dec3265015894073ec2e694dfb505908317a99f2aef42cbf11d128","observation_id":"2de92e6a-ec70-4159-9a24-cf51af5f8e47","resolution":{"observed_at":"2026-08-07T12:05:26.085023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08740","last_updated":"2024-06-02T10:15:53Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:30:03Z","title":"Reinformer: Max-Return Sequence Modeling for Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08740","snapshot_observed_at":"2026-08-07T12:05:26.091332Z","title":"Reinformer: Max-return sequence modeling for offline rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.091332Z"},"links":{"cited_paper":"/paper/2405.08740","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:7334725c61a98096844155477fa73a3ddb88fc733d2207579a3406aa5bbc8308","observation_id":"1267e842-1074-4441-b705-b7277e3483cd","resolution":{"observed_at":"2026-08-07T12:05:26.091332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.495575Z","title":"Revisiting the design choices in max-return sequence modeling, 2025","venue":null,"work_id":"c1be6fd6-59bb-42d6-a186-afdd116f9c7e","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.095894Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0126151d05f644d722789dcacab0963395b2a43b3192991e008ec5c6d7d570da","observation_id":"ad6054d5-8274-4dd4-b327-6f158fb0db69","resolution":{"observed_at":"2026-08-07T12:05:26.500024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.101533Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.101533Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:039a0bdb788066b6e46e6f9d386e2c2d871c64b463124df43e37f75779164afe","observation_id":"fc578017-cce3-4fd5-bb09-46cadeecab2d","resolution":{"observed_at":"2026-08-07T12:05:26.101533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T10:56:37.642977Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2506.00795."}