{"as_of":"2026-08-17T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e5a19e30656b57dca64a73c26eb1dc07cf1f08ee6679570468856168faa2b6d","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:38:43.803126Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21136/citation-record","integrity":"/paper/2606.21136/integrity","json":"/paper/2606.21136/citation-record.json","paper":"/paper/2606.21136"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Learning to predict by the methods of temporal differences.Machine learning, 3(1):9–44, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:5309941cb344c1d8c6672ff3425a3b35ddf31be48613f6113a0e170d7aeb9bed","observation_id":"4e1e084f-d42c-4d15-8c27-efee6ae807ed","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Q-learning.Machine learning, 8(3):279–292, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:3e0b0b84c568d86546fd896fa1912f22ebdeb71a527251a3cef58b6bf3fbafbb","observation_id":"ff74459d-d860-40c7-9619-804708ea7e88","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:753d47a12214219219ff4d5a473ec3e3d3f4a1597454c169944cf93292d6b9b7","observation_id":"ba73f511-03e2-4d80-8765-caf891bd3712","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Mastering the game of go with deep neural networks and tree search.nature, 529 (7587):484–489, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:05d7759f180df9701c2bdc0fc9f0aa791f411e23c2159dc616cef25ccad8aefa","observation_id":"8e382c61-6075-45ae-aa07-420ead382bff","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Mastering the game of go without human knowledge.nature, 550(7676):354–359, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:165ddb161fa5727aae6639b49e302428a4aae78920067289c2e304d6d7c547df","observation_id":"f55a9e2f-b1f2-42c0-81dd-473285e312d4","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:094796466b03cab7167ad598478172038b0824ac6aad9f3ea1c0c0560dc7b06c","observation_id":"be62d276-2bb8-4f7c-af7e-585c5ab08cb3","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"A survey of temporal credit assignment in deep reinforcement learning.Transac- tions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:b36e09bbf470a4ff44a1fa3752631d2354bc9c53526c5ceaa504068f9b787c09","observation_id":"ae82ef4b-7692-4cc2-934c-ce59fde0d832","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Optimizing agent behavior over long time scales by transporting value.Nature communications, 10(1):5223, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:5e4ce22980ea4ba5f60c6f12a6666f61317d99bb30af3fcdc2b44c5a62f0b7d8","observation_id":"8b00a4a8-39fe-4285-9d8c-1f59e5150319","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Is value learning really the main bottleneck in offline rl? InThe Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:56118677676bc4c0fd7cb076dfd32e3009daa8c8a7bb66e071b4e7264da41012","observation_id":"07f7f2ef-5880-4bae-bcdd-52adab8a9046","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Convergence of stochastic iterative dynamic programming algorithms.Advances in neural information processing systems, 6, 1993","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:2504acbbd9eb0c6ea121449378cedad7854e03d0e03badd916d1693759228673","observation_id":"f7801efc-da11-4091-95a0-75c045ca8e20","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Analysis of temporal-diffference learning with function approximation.Advances in neural information processing systems, 9, 1996","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:bd93eacabfebe48b7a8fd579e71903de655fc1fab7c3c7d7b21098d692b2fa5f","observation_id":"d6dc7829-2c1c-4320-8ace-02411a00062b","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Multi-step rein- forcement learning: A unifying algorithm","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:05565adf3833b303aa1a21569893b5f7fc8197c3d4eb3bac467e7afff2eb19f2","observation_id":"e598c191-f7e7-4545-8bb3-f826596fb6d8","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Horizon reduction makes rl scalable","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:5790d9e3409779f8a3f121a5b7c64c23970c0b8ec1318370b94dc048269dca4b","observation_id":"a2142cf8-e62d-401c-ae6a-8026fa99b18a","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Td_gamma: Re-evaluating complex backups in temporal difference learning.Advances in Neural Information Processing Systems, 24, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:f9edf21acf4912ac0fe010eae31f252c2faf892af43402cbba9ab37c325d4b3a","observation_id":"2f4c06a0-09a3-48b7-b229-9b7bf11dbe76","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Coarse-to-fine q-network with action sequence for data- efficient reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:dc000ec9d28e43eb494a6928b8945e534690ed07c4d7a15c076637ef3517f6bb","observation_id":"708e183f-ed42-454a-b096-38193cc25133","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03660","last_updated":"2026-06-05T11:32:38Z","snapshot_observed_at":"2026-08-16T12:52:47.354222Z","submitted_at":"2025-03-05T16:47:36Z","title":"Chunking the Critic: A Transformer-based Soft Actor-Critic with N-Step Returns","version":4},"cited_work":{"arxiv_id":"2503.03660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03660","snapshot_observed_at":"2026-07-04T06:19:37.919957Z","title":"Chunking the critic: A transformer-based soft actor-critic with n-step returns","venue":"cs.LG","work_id":"f57a4b11-f786-44d5-9b30-da2ae495bac4","year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"cited_paper":"/paper/2503.03660","citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:d4316d06e3fc1d878a0e4717bb9332100f3d67c91e9bd5a5a7a37afb5d0ab640","observation_id":"d64887ef-8370-4b33-81f0-fd90dc2d4a36","resolution":{"observed_at":"2026-07-04T06:19:37.921595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Reinforcement learning with action chunking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:9b13d61df2c8e73e38e875b0ce9e785c7fd02d51836d5f09ee492ad9f27d7560","observation_id":"b314f8f2-367f-454b-8054-e97eab2948b9","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Decoupled q-chunking, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:052aa29451e5c606ca34a1683d77768f42b38c595e325af595f784216ad25940","observation_id":"5cf95b01-4642-4459-960c-ea4c00a90007","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"A distributional perspective on reinforce- ment learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:e3840598be072cfc5bff25dd83c6dd07999d9712c8530bd13514096569611c78","observation_id":"304cfa38-a896-471a-b1d1-0ea007335653","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"floq: Training critics via flow-matching for scaling compute in value-based RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:185aafef8038ebf70a4073852e58603ccc6f0546bec198ab0813b73f4fd028f9","observation_id":"9e5bde1c-3f2e-40d2-b3ba-3c60aff19b1a","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Value flows","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:1df81408405751254af823760ebc1a58969e31a5c65b229f00d551368e481c39","observation_id":"31bba480-bef7-4b32-a0ec-592890d8afaf","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Temporal abstrac- tion in reinforcement learning with the successor representation.Journal of machine learning research, 24(80):1–69, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:446f118d078c67bc6838d90feea788e46b9335020fb5dde79a547861ef19a784","observation_id":"90b7df33-985d-4b4c-9c57-0b75a609992c","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:50e0b5fc027896faa6987080ef4619f2aeb626eef78f248a09ab4b9e75afa14b","observation_id":"fc610f11-2da9-4a5a-8baf-a3bf1363ba8c","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"University of Massachusetts Amherst, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:6f0ad108d519f5cedbf94401693952bc8897beb36c502f8142b7acced718e4de","observation_id":"18711e13-d8de-4b1d-a722-fefa0124b2b5","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Learning options in reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:d8ddacf660f620a5fdccfb3706c94be58ad36fd876fb4c0f37c3f0a41b6689b9","observation_id":"2c84c3a0-0fb7-453f-999c-4844beb5be74","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"The option-critic architecture","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:539955d6b508da519a5ce79ed392bdeea215932d02431f66187154bff29b5980","observation_id":"f68be6ab-c195-4e38-b399-fc036e222120","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Learning abstract options","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:c479826c40cf3106535316c3a8ec07904679bbfb23ea9c6701b28d22c36a8a76","observation_id":"16a766cd-d281-43e8-9a9e-e3491c41970d","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"A policy-guided imitation approach for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:64b607d0a1e7d8df77f3a673223bc1efa0ebc291e5566426700e908fc7d15765","observation_id":"5476a698-bdff-4e43-a81f-d6e87c7d1dd3","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Hiql: Offline goal- conditioned rl with latent states as actions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:001c7f37cd21c63b4c3a6cb3dc93ba5def563b97341ee45f0ebd92e49f917d9d","observation_id":"edc20e7e-0272-4e3a-9485-7a371328241f","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Data-efficient hierarchical reinforcement learning.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:43ae3d415ee5d566301f9575fb52d5f3a7f90547c8e06f3dfea8d564368f7428","observation_id":"9c4d5da7-c5d8-462a-a0eb-69993c53d6d7","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Ogbench: Bench- marking offline goal-conditioned rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:09c92f2be409d098d3dd66b41fbd816bff7a35c5d902458c2e5a04fb5c5819bb","observation_id":"b9444543-ae92-498b-bc53-25a75908d319","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"John Wiley & Sons, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:3e75379eb4750b59bcf555c546dee6397e9c423e6f4a18fb256bda47cf305acd","observation_id":"15df0640-1466-44d1-b213-cd980375b363","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Bridging the gap be- tween value and policy based reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:ac8c466bae6f0577cdfb37bf070fb6dbaab54408cd72a2ad9cf76befe94c8bce","observation_id":"9e3b6525-ab96-4955-b1f3-e4cf6f3b5291","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:a0cf9fdd29c5c91535a960c3758711de9a750f42f97ae1c70b9ac4a3690a244d","observation_id":"32410af2-2484-493c-ac67-0d8f4fb1f62f","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:58cbf764188266733ac1f33ba8d7aaadfbdcf17fa99e0fe8cbc868c25cf274e2","observation_id":"7f49ce69-4a9b-4f36-8801-bc0886a6ec61","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:128ced3b2046dec1353d1b932185b7015973178e06c0f75ef7b58dba09cab1e1","observation_id":"ad3787dc-9707-42f6-91be-64a5e6061c1d","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Learning from delayed rewards, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:6117951dc01c8b76738455adb12d9029902e3956053b8cbe8160c20e17ce2227","observation_id":"38891176-8fe2-4cc5-b1e0-7324e646a8f7","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Incremental multi-step q-learning","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:01470e8c7764a17a07533af67602ec0cdf2443e57ac0d3c66091c6a76ae0ecca","observation_id":"1fdfc6f1-b556-4700-9766-e69ae6162343","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Policy evalu- ation using theω-return.Advances in Neural Information Processing Systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:e36d4775fdf6a1ea8fb5154fbff7224726d167c5099d081d20edd4e4e3d3eb6a","observation_id":"f4ca57ab-451c-41c1-a73d-75a949f403ad","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.Robotics: Science and Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:b13fd6a0807733218e54896b745e16bd3c928ba7ebe461013a57acc896412329","observation_id":"9be2d08a-025b-4f4d-89a8-aadaf58ff3d4","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"John Wiley & Sons, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:cd0caa7851b689be708d3bd771b8cd2704214fff4b2fbd57ece3ef1526f1d35e","observation_id":"098e19ef-733f-49ff-8979-0b591cb32a84","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Feudal networks for hierarchical reinforcement learn- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:e9cdfa5f6c1a5e89f0e75e43ef2a0db5657868414a9bf8c1e93b56d75f4e6ab6","observation_id":"1c65e21b-56fe-4008-b99e-c9d1dd2951b0","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:e83b2efba4f706314eb7bdd3479642e251444bb40e70b23d28360f6f123693af","observation_id":"ae9b5635-871e-457a-93cb-9fe23948a0d1","resolution":{"observed_at":"2026-07-04T06:19:37.924825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:63031a42b9e6dac23ebde9269a47ed2e60ec1190cab1e140772bcea0bbb0dac3","observation_id":"881da501-79f0-4fe3-a9b2-76559a3fee98","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:d05fa4519aca627aa77e4780dfb20fa10b515f29c4db22e3096ca5e90ea07058","observation_id":"e937a338-424f-481c-a77c-bdb858e017fd","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Dichoto- mous diffusion policy optimization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:2a5293c800098ceb42c925d9838384f483f59fb5909e59dfdde1f35ccbfbddc2","observation_id":"b26c65ea-5dab-42ad-a761-5e4a2d6130ac","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:a4a888211ec09f0a9829d302e3a17b2bc83feb616b759a58b9053c4ef67384b8","observation_id":"cd856d21-b402-41df-99f3-f030f5c4b6fd","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Denoising diffusion probabilistic models.Ad- vances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:66af588c8a0d0807dff9ed4699f2457e7fecbacf759800fb9c2170cd82141e16","observation_id":"588ff4bf-ef48-450c-a38c-58afd39d4eb2","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:8aac8649609084824f54fddf3393910abdc9858a7e2723bdcb58640014c1dd49","observation_id":"8080cfe6-8dba-455b-b8e4-d4061ed368ce","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Towards robust zero-shot reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:262902595cccff1cfbdc94cbdd5f961f6c0f87965bd7f407793ab8f64d96b4ed","observation_id":"71eead67-ea6e-40ff-bcbb-78a974e02e04","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:4be46ed23899c80e8e0b0086bda0e7fc22bdceb72d0ca99d5760a9613575de44","observation_id":"72199c30-b291-4b1f-9523-1f37db045b96","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:8c8fe6998314c5619dba421294b241c4541422dd070c710fdf125010a1bd6e9f","observation_id":"31be72bd-bcb8-4bb3-9973-cd3629d14b17","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:4deeb2a235e680b1ec4471c1b2dbfe5e0634d63e387f56894f8b343ce519239a","observation_id":"5746736b-c25a-4f6f-88d5-7e86dee960e4","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:53d2e0a45cb8d24fd71f31a1b6bed7b6db72a30170fd50b496f504a0061d9e03","observation_id":"7e0498c7-4982-48ce-ab94-d84277a20b40","resolution":{"observed_at":"2026-07-04T06:19:37.931325Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:9c2c40aa590d425f3a934bfdcf9299d22b41cbf1bbccfe7681193a36c7365c26","observation_id":"06ad89fe-348f-4091-ae54-899e989a3a24","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:0eae2febe286c53144ab7560b2e5c8770c7f8fba38495538f0f2f9a8df9ad93e","observation_id":"0173a308-994c-4d60-b43a-620b7b7f4b88","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"A minimalist approach to offline reinforcement learn- ing.Advances in neural information processing systems, 34:20132–20145, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:3645ed8a14de907002fe96655fb73a0c4a707e826ea00aafff9153a7825a207d","observation_id":"b65b53b8-fe2a-4a6a-8a6e-af728e135e53","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:4937743339a794edc13334f338bc8aee86fdfad1b1ba4a396c22bf4f850ebbd1","observation_id":"2a1fd1ef-a8d6-4731-a10b-3b872ebc7660","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"When data geometry meets deep function: Generalizing offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:d05f1cac1e1ba9a05b54ade6b168ebd7e184f6372eda20abc0bbb03a70a0087d","observation_id":"2b70cf63-911a-41bf-af07-cfc5c7aa73a1","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Look beneath the surface: Exploiting fundamental symmetry for sample-efficient offline rl","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:2e7eb82885abaaa63476f97feaa4737ce143250b851b0f8124b4cd44d040d31c","observation_id":"f4e0ea1e-f596-4343-aeee-7ad9ed6d2a58","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline reinforcement learn- ing with fisher divergence critic regularization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:68987ff70ce2e8387298fb2aa085ad6be80d026ab8b85aeef44777d7cd92f2bd","observation_id":"a7865b4a-80aa-4a77-b2b0-6b87e55f6e83","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:a5a8006e347de79c78807936f8f0b1fac391fecc4ea71e0dad3d809f01604910","observation_id":"f14b3940-3c9a-4446-9803-3b91f3cec9b2","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:364ea7ddc329eb7bd19d4c8cb59bf782c18f46391bd822fbf2f33b607d8461ec","observation_id":"3adfc898-376f-458e-812a-bad7d63bf04c","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Constraints penalized q-learning for safe offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:bbd86235ba94c447589e3236900d9241a147807476bc922c45feecfa33aef141","observation_id":"9c16bef7-267b-4161-bf1f-c396698d5c4c","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline multi-agent rein- forcement learning with implicit global-to-local value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:c9a734ba6bd840adaeb7e742007a85635620d18745fbfca3f7329764b4b5a710","observation_id":"16df5df6-ea72-47e1-b3cc-ab6fbdea108d","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Weiss, Niru Maheswaranathan, and Surya Ganguli","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:dde4a44d24c9f32a98009d50eb1021c9ea568c9eabb9341e7fa49016ae4d78af","observation_id":"bcea7810-e5fa-464a-8ea8-52a2f0726b30","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:16d2f189624b61669a8e85d00bf5368173941e1f99abbaf823c1da2a56bc7bfd","observation_id":"02edb6e5-09fc-4ad7-81ce-4d9904f0f004","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Score-based generative modeling through stochastic evolution equations in hilbert spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:0d2801c0ee4a276d3a7e3deb0269aa884b12664fa3f6ec55db8618de27a8a6b0","observation_id":"bf71de4e-6427-4726-b52b-3167ca623e42","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:fc3edf2128993fe7c597f3534daabd1450b71fec64434cd09d78e6fe7a784aab","observation_id":"799d3ff8-c920-46ac-b4f8-4c9176c15309","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Hunt, and Mingyuan Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:f5a292c1051767fe642366d8d786c57edda6b5b21f18a7369ebafbcfcb14e9c7","observation_id":"a5da92b9-19de-43f3-882b-7b698606081c","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:9ade301018931ef4da66f9ae1243a6f4e65f066caa5d7e6aafae8462b057bcd1","observation_id":"59bc57ae-4a49-462e-873e-54bd34b449bb","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline reinforcement learn- ing via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:3ca271e3aff37edb620ddd6d26f0ae68015c01825dc5137181f91d158ed00e13","observation_id":"d35d20e2-c7b4-43ee-b794-fb299c5f7583","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:210da115d0dd04ca368624350ba160ffb5e2f3d1dcee0df12df237484c7ae7ea","observation_id":"21c33a3f-4228-4782-9fe3-864a6f59f690","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Diffusion guidance is a con- trollable policy improvement operator, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:a57ec1d93a8f7a7be55a3c567907f7361b60eb17cd628b99f84722262ea621cb","observation_id":"81df0d6c-a69b-4cbb-a1c1-11176ca99791","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Scaling offline rl via efficient and expressive shortcut models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:399b6c96b7fed8a9337d315da711f12398b97ea9be79cd608ce7bd6dbaaa8baf","observation_id":"8cb012a8-55af-4b86-aa0a-7ebd057a9adb","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14234","last_updated":"2026-05-18T22:43:56Z","snapshot_observed_at":"2026-08-14T19:04:38.684749Z","submitted_at":"2026-01-20T18:45:34Z","title":"Q-learning with Adjoint Matching","version":4},"cited_work":{"arxiv_id":"2601.14234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14234","snapshot_observed_at":"2026-07-08T11:44:51.136563Z","title":"Q-learning with adjoint matching","venue":"cs.LG","work_id":"dbb69860-e53f-44be-b07b-d0d014ff8d2d","year":2026},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"cited_paper":"/paper/2601.14234","citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:541d0316064adfe7f21ff5d504cf770050a958ca46a20128a95dbe9322da0719","observation_id":"c90a53ab-ab74-4496-8243-7fbe4cbb3d5b","resolution":{"observed_at":"2026-07-04T06:19:37.928185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:fe04e1ed79c1b8307827fe5ce2c21d8d87bc21df3f835f4fe79eea0bdccf9175","observation_id":"06bc1572-333a-4214-ac87-2181deef392a","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Unleashing the potential of diffusion models for end-to-end autonomous driving","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:60223445c00d9dd1fcb61cfd361019964b15b246f5170e84e1fc6c9676fd0df9","observation_id":"e0846e62-9c6c-4efd-9975-7901c3a05b69","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Stop regressing: Training value functions via classification for scalable deep RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:10bdfdc31e9b8366354d1c2bc07e9e2e3944a8cfd7ae3c06673e4e070c2782ad","observation_id":"39f2e062-feb3-4415-a3e6-3d051d790040","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Dsac: Distributional soft actor-critic for risk-sensitive reinforcement learning.Journal of Artificial Intelligence Research, 83, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:1b7d75d048d6a85cf6f8502b82fae50034708e4679f803190ccf3ef8366d0065","observation_id":"e827b47e-0581-4be6-ada2-c585ff96e94a","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Q-transformer: Scalable offline reinforce- ment learning via autoregressive q-functions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:ce3f6af58fdbffce54ee22956beec97428998d55644c57264871212b8badcd19","observation_id":"e04b4a0a-bdf1-4d31-8e8f-2cd1177d323a","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Offline actor-critic reinforcement learn- ing scales to large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:2850318e6a235762ce9c4d1c5472afe05e3edc1994a6d57426cfe9faacdf4ab7","observation_id":"6a5d6b76-7af4-46c9-92b8-89d097e7321d","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Mixtures of experts unlock parameter scaling for deep RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:256d22471d3deb38f8d5d891052c92160cf56c2a6e8691c441656686dbd29100","observation_id":"4052f0cd-cda5-41bb-a93e-29ee9eb05508","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Feudal reinforcement learning.Advances in neural information processing systems, 5, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:8914bc41254ef78682d4430454b46a93e7133ec7627116d1542e6d59478efe91","observation_id":"5a4196ac-39d2-4c34-bca3-3a22c13e5172","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Hierarchical reinforcement learning with the maxq value function de- composition.Journal of artificial intelligence research, 13:227–303, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:32f05eb3e123303a14408e5bb8127c9bb7e38759e544fe4b556a9b8d03b8ee31","observation_id":"30dba910-41d5-402c-863a-bdc1178884e7","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Strategic attentive writer for learning macro-actions.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:a21c358221c483232e294b5bf405f0d22bb7d455572ddfd1d77745ead38c2d13","observation_id":"e5d3140c-8e9e-4821-830e-dfa71a4c4511","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Hierarchical reinforce- ment learning: A comprehensive survey.ACM Computing Surveys (CSUR), 54(5):1–35, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:5340a6a74dc55c378999c8802179904e0aaec2ed7ad1a288e5f9af5bab39cd34","observation_id":"630a80df-79c5-4d5a-a630-b65b3a758232","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Hierarchical deep reinforcement learning: Integrating temporal abstraction and intrinsic motivation.Ad- vances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:554cbeee770b279636ecf587ed2aa2f750d1307c9b77e5242c41dcc3fae5ded6","observation_id":"5105a454-9f35-41bf-b6b5-7b96e6cdf342","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"MuJoCo Menagerie: A collection of high-quality simulation models for MuJoCo, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:c1bfcbc4593af212f983399660ad47cdb4924a7e1baa3709baeedb1a23e75b55","observation_id":"c6f4b1e2-e1bc-4ea2-a2b9-7eb0ccbc1183","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforce- ment learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:18c7d68d34caad63850d6001956bed4c158889dc0dddc38ea7c3bb1fc8640522","observation_id":"74a291ea-9b75-44df-9e83-d3fcb5ffe1e1","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:8dc61a82672e4752521346719c21c4285aed5e76413cc1140d845eb37ec50e42","observation_id":"4bb7b916-bd7b-45b0-a94d-d9306db0fd03","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:38:43.803126Z","title":"i−1X t=0 γtrt + k−1X t=i γtrt s0 =s,(s k, k) # (21) =E i∼Unif{1,...,k−1},s i∼π Eπ","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:43.803126Z"},"links":{"citing_paper":"/paper/2606.21136"},"observation_digest":"sha256:3e43092deb2fa45b42c4da689f6fee61f177e281ebbd1cf8e7b04ca698f0020e","observation_id":"63ce8e93-0fc9-4d48-b2b4-d8a1a5d2acca","resolution":{"observed_at":"2026-06-26T14:38:43.803126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21136","last_updated":"2026-06-19T06:20:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T17:59:14.169231Z","submitted_at":"2026-06-19T06:20:45Z","title":"Horizon Adaptive Offline Policy Learning via Value Stitching"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":88,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2606.21136."}