{"as_of":"2026-08-09T21:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bbef74328df7e8a1b9703300b219860576b6024dffd34adfaf2418b90aaa0aa","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:10.275156Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08463/citation-record","integrity":"/paper/2506.08463/integrity","json":"/paper/2506.08463/citation-record.json","paper":"/paper/2506.08463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:19.078541Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? Advances in Neural Information Processing Systems, 35:1542–1553, 2022","venue":null,"work_id":"c957c6a4-2080-4e11-8dd5-ed200292aab7","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.103676Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:810d28450508bb41d4261caaada2a72a75c50a9ea4d9193025a06c7d5bb7d8b6","observation_id":"fcfc7757-4214-4f91-b109-8f106280f373","resolution":{"observed_at":"2026-08-07T05:19:19.174686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.889811Z","title":"Decision transformer: Reinforcement learning 1For two distributionsPandQ,P≪QmeansPis absolutely continuous w.r.t","venue":null,"work_id":"729a4c2d-7cbb-4206-b7ba-f0aea0790f41","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.192132Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:b3ca7ee3e59b71a719c90db1628fe0391f25eef6ad216a3ba7d6dafdb0d500b5","observation_id":"5b9ca6b3-c313-4672-b65b-880e92d71eaa","resolution":{"observed_at":"2026-08-07T05:19:18.989128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.678476Z","title":"Rvs: What is essential for offline rl via supervised learning? InInternational Conference on Learning Representations,","venue":null,"work_id":"cd5f87d8-c76e-4e97-a9e8-fbe8f4be64ce","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.330667Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:72525288d9aa345109379c9674bef1b7ba95d3eb866a5f838f06505454773aef","observation_id":"632f3e8c-a2d3-4cd7-99cb-80ca75d930d9","resolution":{"observed_at":"2026-08-07T05:19:18.778572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.249287Z","title":"Imitating past successes can be very suboptimal.Advances in Neural Information Processing Systems, 35:6047–6059, 2022","venue":null,"work_id":"b067732d-92c1-42c5-9614-dba35f985c5e","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.670336Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3292c86da9102bac30a91a70dee5b0921908ccea133bbd9e9108581c308055f8","observation_id":"8059f672-d218-4f2a-bb9e-0686a58617fe","resolution":{"observed_at":"2026-08-07T05:19:18.350689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T05:19:04.868201Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.868201Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:42fccd4bdab6b627ac01c3909e2a7c58f6722b6df3bbd5fedfb2452038011ee6","observation_id":"2ecf1c2e-1149-4524-a53e-55a7f1a8a4b7","resolution":{"observed_at":"2026-08-07T05:19:04.868201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.080696Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"8011b270-cc99-4701-9bd4-6cb52d7fcb63","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.017626Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:d2cf642ae08407ca912fb631b1bdacfc38ca91f1b23fb133eb7d0c72048797a1","observation_id":"6cbb6611-c082-4463-9026-07bfd459cf24","resolution":{"observed_at":"2026-08-07T05:19:18.154249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.875760Z","title":"Generalized decision transformer for of- fline hindsight information matching","venue":null,"work_id":"2b6a3cf7-5a67-4e8a-969a-eae9901a0a07","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.154444Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5be3adf9339479fb39d25070caea5f63361037afd560af94846b765194b2f00a","observation_id":"5655c842-202c-4de9-a6f0-f83ed89e05dd","resolution":{"observed_at":"2026-08-07T05:19:17.981506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.711559Z","title":"Act: empowering decision transformer with dynamic programming via advantage conditioning","venue":null,"work_id":"ba052e9d-14a1-4908-9e92-83ff1f7f8d86","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.328078Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ddeb2cb06c8c56eec72ea4b4c094ad6453a6a1868e2947a9162a8c764d1c4c07","observation_id":"e2aa48c5-3aa6-4a9d-95c2-bd9a5f79d2c2","resolution":{"observed_at":"2026-08-07T05:19:17.798842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:19:05.443153Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.443153Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f21d31c6767a9fcb14de6ada1daa8905cded2f804f92c8655acd39455230a6b4","observation_id":"3269d05b-354c-48d7-afa8-da6aaa6f9c35","resolution":{"observed_at":"2026-08-07T05:19:05.443153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.503306Z","title":"Q-value regularized transformer for offline reinforcement learning","venue":null,"work_id":"a0a0f26c-c27c-4fe5-b310-7904dc69c515","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.597675Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:aebb7ea7ca6bfa7796a1d212107a0f084994a8583727483da7c1839ece86f69a","observation_id":"c368ab03-1013-4091-9e99-89f1c5170047","resolution":{"observed_at":"2026-08-07T05:19:17.590710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.286611Z","title":"Offline reinforcement learning as one big sequence modeling problem.Advances in neural information processing systems, 34:1273– 1286, 2021","venue":null,"work_id":"edf115dc-9554-4fbf-9610-d5df9881ed25","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.742356Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f8c5553f072be50af772bfde83b518919aab1f1484724698a9f269c261ee665c","observation_id":"01b99dd9-f6c6-4d7e-8696-ab0812b89bc3","resolution":{"observed_at":"2026-08-07T05:19:17.389293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.087694Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pages 5084–5096","venue":null,"work_id":"10cc0f21-16fc-411a-8243-178a2888e28f","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.905336Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:171693bfb7d0ba15f31fefc0dcb5abc85f8b2903a37093bb5757ae62e0f1908f","observation_id":"a250da26-9d7a-4fe9-8485-5e895f9eb332","resolution":{"observed_at":"2026-08-07T05:19:17.179796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.883566Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":"4f26e67a-c4a5-4134-b4b4-d5e9c81e824a","year":2013},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.058393Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:2928b25dd1ebb99c52585c998f0e50fabcd7844d4806c9d7bb11a05896abef2c","observation_id":"7f6df767-4bcd-4739-8a4c-fab9b5d99d93","resolution":{"observed_at":"2026-08-07T05:19:16.979615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.698927Z","title":"Quantile regression.Journal of economic perspectives, 15(4):143–156, 2001","venue":null,"work_id":"24daaae5-0651-4e5e-a11e-842f9483bb45","year":2001},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.236473Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:14c8896dad12f4da7660066c4bc65e23e0fbd85b91510edbb18000e0a931231c","observation_id":"cd59261a-7881-4ac4-bc9b-a754d3a0f442","resolution":{"observed_at":"2026-08-07T05:19:16.814473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.547057Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"c2c02de4-9213-4504-a39f-80338d5acdef","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.387415Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:650e1a843e88f0171f50a19d1b6867b20863c70f37906ddad2c4516b618e52a2","observation_id":"f822402f-8bc0-4912-83f8-edbe38a56fe4","resolution":{"observed_at":"2026-08-07T05:19:16.614230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T05:19:06.527500Z","title":"Reward-conditioned policies.arXiv preprint arXiv:1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.527500Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:250869a73a87e49d9a3c6aca9446f3c57e8f8694330f65dfe5a2e68fccbb9f27","observation_id":"6c5875f2-64b1-4600-ae59-09958a242422","resolution":{"observed_at":"2026-08-07T05:19:06.527500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.328741Z","title":"Conservative q-learning for offline reinforcement learning.Advances in Neural Information Processing Systems, 33: 1179–1191, 2020","venue":null,"work_id":"92941f57-38c5-4458-98d8-a919f69d0b66","year":2020},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.681264Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3ecf6e2f48f6af8a1b5281ccc8551a7857c1b9722fb4d9ec002792d3f849ae46","observation_id":"b8b33b93-0360-41c1-ae74-3d9cf32ad1c5","resolution":{"observed_at":"2026-08-07T05:19:16.417121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T05:19:06.860433Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.860433Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:277b6b051f96e6a30937d77db6a39ae4b8f2592a2dee272a0a2224e985e708ed","observation_id":"767bf042-42de-4d6b-abd8-08006375deda","resolution":{"observed_at":"2026-08-07T05:19:06.860433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.153146Z","title":"Deep rein- forcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"c33529ce-2f8f-4584-9852-4a2072fd2aa6","year":2017},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.000640Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:c9a82fce1b83b74ad3491f874adc43ca2cb6c9831bb15ac7f83393a6e415fa4f","observation_id":"2fe8ce3c-613d-4c92-9751-86e2c1fe269f","resolution":{"observed_at":"2026-08-07T05:19:16.248503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:15.960025Z","title":"Deep spatial q- learning for infectious disease control.Journal of Agricultural, Biological and Environmental Statistics, 28(4):749–773, 2023","venue":null,"work_id":"7d9e0ca3-54a0-4a5d-80c3-1ab4b9f9fe32","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.146714Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:47883eabda5a70e63626667e0cf5940641d9d7199a422aea952eb96fdddc11fe","observation_id":"8858455d-b390-4bb0-acae-6186137f7915","resolution":{"observed_at":"2026-08-07T05:19:16.058975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:14.008123Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":"692c3435-aa12-4665-a033-3a50a29fc1ea","year":2015},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.322593Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3a5cba567da3cf384cab7c001de6047d6a5241f2e4f0227d1ef701abca0dc6c6","observation_id":"9b0d61b0-f99f-49c0-a347-8858d116fba9","resolution":{"observed_at":"2026-08-07T05:19:15.881289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.814495Z","title":"Asymmetric least squares estimation and testing","venue":null,"work_id":"daf8b08e-a3fd-4f91-9005-7a926d76235d","year":1987},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.467721Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:a26fc5f208fb16bddd41065909c07d3fc32f696b1f53738130e1eb27aba24a21","observation_id":"be7d3c4b-a6ba-4257-915f-69937ccbad93","resolution":{"observed_at":"2026-08-07T05:19:13.905451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.637528Z","title":"You can’t count on luck: Why decision transformers and rvs fail in stochastic environments.Advances in neural information processing systems, 35:38966–38979, 2022","venue":null,"work_id":"a01fae47-74a5-4488-99eb-e602eb28f933","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.618289Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:a43fccec5abfbc8de6f86859614386873eca0b2d8ffdef963039fd486d3f5bfd","observation_id":"90b11ce6-50d2-4a37-b5d2-e924eca9d161","resolution":{"observed_at":"2026-08-07T05:19:13.732547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-07T05:19:07.756599Z","title":"Reinforcement learning upside down: Don’t predict rewards–just map them to actions.arXiv preprint arXiv:1912.02875, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.756599Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:0365370e9093a58ea3d484cdb2858eba527893e8a049564051cbacffaf777d75","observation_id":"5717991e-91ec-4bfa-ba3a-df3a467f88cf","resolution":{"observed_at":"2026-08-07T05:19:07.756599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.479632Z","title":"Reinforcement learning in robotic applications: a comprehensive survey.Artificial Intelligence Review, 55(2):945–990, 2022","venue":null,"work_id":"daa73c30-e224-4dcd-881f-27d17b13ad2c","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.874637Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:196b34f135e5e9f239316fd201a4f047969c00a1d0eeb620b52febeb59b428e7","observation_id":"1cca5d79-1339-4d7a-a4c9-664a40f50954","resolution":{"observed_at":"2026-08-07T05:19:13.536857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T05:19:08.014844Z","title":"Training agents using upside-down reinforcement learning.arXiv preprint arXiv:1912.02877, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.014844Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5688dbfe763b32a19081cdfab913d29634d5995d47226210e2ce9cd41970e450","observation_id":"1e69c1d7-7926-44ab-b3ac-bb44ef679d6c","resolution":{"observed_at":"2026-08-07T05:19:08.014844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.283386Z","title":"MIT press,","venue":null,"work_id":"2e20aad0-8e03-4b88-8520-e7dbaad9edc1","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.194854Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:21afd7338cc2b51c83332ca8a43dd40f68fca8fa9816420fba7c393e37e9b1b0","observation_id":"2afd2b9d-7214-4a41-9df1-ea4084ea1283","resolution":{"observed_at":"2026-08-07T05:19:13.380306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.084309Z","title":"Temporal difference learning and td-gammon.Communications of the ACM, 38(3):58–68, 1995","venue":null,"work_id":"bb8ad082-daa2-46e5-b97f-d00811817a49","year":1995},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.280991Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:c5653df78355cc683f3bb5be5ffabd0656c1fdf81ccc7625bf00884e1ea06ded","observation_id":"721c7b5e-3a48-45fe-9077-1e0d3ef24a7a","resolution":{"observed_at":"2026-08-07T05:19:13.180697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.908798Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":"cb99db72-42ef-4e37-963e-ff45ba585ae3","year":2019},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.452464Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5d6ea3457a0c45351e11e3a9ec74f1cd2c507b59eb6fac50e05b33cdb7b86bd3","observation_id":"87aa220a-a2ed-477e-a513-63bba5759d4e","resolution":{"observed_at":"2026-08-07T05:19:13.005163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.615517Z","title":"Return augmented decision transformer for off-dynamics reinforcement learning.arXiv preprint arXiv:2410.23450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.615517Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:8b9aadfabf8973504db9feb9a7c113b0b43b021a09d16ee7213e95e19a675e3f","observation_id":"6141da23-8251-45f2-a0d1-7b5dbb5fea7e","resolution":{"observed_at":"2026-08-07T05:19:08.615517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.712162Z","title":"Q-learning.Machine learning, 8:279–292, 1992","venue":null,"work_id":"ca8dd677-4829-40ce-899c-acb7c8718bee","year":1992},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.701647Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:8bdbcc0666f68854bf4402d3995e767db10ab1ff6ec5fdf573e6452e0fd16709","observation_id":"ff035164-e227-4e2b-a65f-8cbc31daef0d","resolution":{"observed_at":"2026-08-07T05:19:12.809949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.507465Z","title":"Elastic decision transformer.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"4310f7d6-e14e-4202-b04c-37ea12a24b96","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.859217Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:84d6f3552927d7df371f57b28aa29b2c57fbaab73d99adfed23517c1af95c518","observation_id":"53389b36-65f8-4b59-9e7f-1c542c47ee22","resolution":{"observed_at":"2026-08-07T05:19:12.608655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.312185Z","title":"A policy-guided imitation approach for offline reinforcement learning.Advances in neural information processing systems, 35: 4085–4098, 2022","venue":null,"work_id":"7271ea8d-8ac8-4565-9648-59e6efda5824","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.061745Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:20652333ca61b4d60ef5c544aab7c46bb09ea7eea2d1b681e45ec9157f515fa0","observation_id":"c631914c-ae8a-4a8d-9b28-261d8d59acbb","resolution":{"observed_at":"2026-08-07T05:19:12.409417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.158265Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"95bd31a7-5362-4f34-b5c8-ee89b83785c0","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.142012Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:6bbd44c89fb3b064474d43238582132979c142aa306bb6b9d7d6d03702b96d1f","observation_id":"f7854296-a476-4262-841e-cfb35771bd49","resolution":{"observed_at":"2026-08-07T05:19:12.219928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.999475Z","title":"Dichotomy of control: Sepa- rating what you can control from what you cannot","venue":null,"work_id":"b7e8b6cf-8a33-4a06-ad49-94ccca22bfe5","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.297843Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:2e9bf48a5d6243db29a775e2708e71edeae5640a120cfb863ebde56c8fafacbc","observation_id":"43b19276-ba88-4e84-8dcb-7e19465c5716","resolution":{"observed_at":"2026-08-07T05:19:12.062449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.803978Z","title":"Reinforcement learning in healthcare: A survey.ACM Computing Surveys (CSUR), 55(1):1–36, 2021","venue":null,"work_id":"b145e650-dc42-45b6-8537-058a5463a374","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.413750Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:61428a311419140e643fedfeeb2fb847fb37e4f8e71a7a7469d3168f9bbf0c2a","observation_id":"a50769dc-a148-47b9-9a8a-774bd96bf1c9","resolution":{"observed_at":"2026-08-07T05:19:11.895118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.631918Z","title":"Online decision transformer","venue":null,"work_id":"ecb82392-626b-4d56-b692-843908744482","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.528698Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:1afa0f86d67e29878af1a9ecfdf42f108635d112274efb011449f549155e36e8","observation_id":"0b35ec78-9d8d-40d5-bf81-1186ecea1ed2","resolution":{"observed_at":"2026-08-07T05:19:11.717619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.448575Z","title":"How does goal relabeling improve sample efficiency? InProceedings of the 41st International Conference on Machine Learning, pages 61246–61266","venue":null,"work_id":"f5cdc140-754a-44fc-b06d-b2b3789f7581","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.716896Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:2b5d858bf94d0e476aa4346514b5d877805f1f868ee96d3e55119c58abaae575","observation_id":"544670a7-2e87-4095-8ce6-248819a8584e","resolution":{"observed_at":"2026-08-07T05:19:11.514778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.222050Z","title":null,"venue":null,"work_id":"9b9f4fcc-b662-4fa9-bec3-6b9ddf00bad8","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.811315Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3a506a81aecafc7ee221dcb49dda8cb6cdd1a62a5d690dd010ce0eb413ad1a68","observation_id":"77d681dd-db1b-4cca-95f7-8e794631c989","resolution":{"observed_at":"2026-08-07T05:19:11.309789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.018148Z","title":"Reinformer: Max- return sequence modeling for offline rl","venue":null,"work_id":"cb40248f-3794-4a10-9217-323a3f258774","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.935960Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:764bf9e026582fa5a1215108884488f7deb2267fa3cf6e4e1fa46c00a918d5d6","observation_id":"496aea22-1320-433e-a1cb-28b8a0d6fb68","resolution":{"observed_at":"2026-08-07T05:19:11.115470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:10.825856Z","title":"Starting from the second stage, π⋆ starts stitching the performance of different trajectories","venue":null,"work_id":"092aa749-8efe-4911-9920-974c185bbc3c","year":2000},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.095418Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:4a5ca405f8cff3ffe53668e5ac013d67417b14a5c7707bf04de19d5a6f88be58","observation_id":"55a97671-7fdc-4e24-9518-930d3c5a772d","resolution":{"observed_at":"2026-08-07T05:19:10.911021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:10.587384Z","title":"We formulate the loss function as LDT−R 2CSL =E τ [−logπ θ(·|τ)−λH(π θ(·|τ))]","venue":null,"work_id":"10e9ae20-b5bf-49b2-897f-53fabd5d209c","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.275156Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3d8bb5a4632060681c52d4462a8276cc07663970cc533745db03d0d6cf31ab81","observation_id":"cd6d66ec-ab1a-41b8-a2fb-2b6f7c8dac22","resolution":{"observed_at":"2026-08-07T05:19:10.716042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.439182Z","title":null,"venue":null,"work_id":"b28d7943-e81e-488f-9c42-1894e4171891","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.464264Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:1a5734dfd6da0e2b752781f7e6ea1f53009b0085143652c16192b8242d7ecd95","observation_id":"da474c82-2cbc-41c7-847d-50e88d987a07","resolution":{"observed_at":"2026-08-07T05:19:18.566541Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":8,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.08463."}