{"as_of":"2026-08-14T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e89da812b7a2844847ef338d8db519ba7c730f71f6184f82dc5c66a9c0704162","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:27.653919Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08417/citation-record","integrity":"/paper/2506.08417/integrity","json":"/paper/2506.08417/citation-record.json","paper":"/paper/2506.08417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.652759Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.652759Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:d6091b0fa067242e83917617686cb018c05cbd51aad61914d33b0df29150f2b4","observation_id":"b2727ca4-f5f9-430c-bae1-d53ed89ade7b","resolution":{"observed_at":"2026-08-07T05:22:23.652759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.687083Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.687083Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:e27a82c3bc6ab33a2f9b0e944ba258497df7cc114ec37ec2f966c5de2dd8cd0b","observation_id":"04f87bd3-0ea1-41e8-bf93-3fa6826f2fb7","resolution":{"observed_at":"2026-08-07T05:22:23.687083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.621878Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"dc0e37e3-d299-4174-bb3a-4728c5581397","year":2008},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.746503Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:cb9086e916abdfea4e94eef95afd5324ea572d3a62eb9e8225b453110c341ca4","observation_id":"b62d4df3-f0fa-4a6b-9e96-2a1417d4dbb4","resolution":{"observed_at":"2026-08-07T05:22:28.626467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.606682Z","title":"Manifold topology divergence: a framework for comparing data manifolds","venue":null,"work_id":"9b3d17b8-b6ba-48dd-ac2b-4c7c93879462","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.776646Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:74c498970d972231fc4f344726ca8bb08b430fac3f05eeccd15e259eb738de66","observation_id":"0012dfda-f904-4179-9f74-4956d0a95440","resolution":{"observed_at":"2026-08-07T05:22:28.611573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.848799Z","title":"Laplacian eigenmaps and spectral techniques for embedding and clustering","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.848799Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:556ecf7a19fc0bc37e6e7934284d7ff6b112f4b5bab2dc6cb7dbd4d9ea41fb8b","observation_id":"77245729-e20d-448a-8673-a1ab89bc83d5","resolution":{"observed_at":"2026-08-07T05:22:23.848799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12173","last_updated":"2019-10-31T14:38:51Z","snapshot_observed_at":"2026-08-11T14:53:41.759137Z","submitted_at":"2019-05-29T01:49:32Z","title":"On the Inductive Bias of Neural Tangent Kernels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12173","snapshot_observed_at":"2026-08-07T05:22:23.919649Z","title":"On the inductive bias of neural tangent kernels, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.919649Z"},"links":{"cited_paper":"/paper/1905.12173","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:68922ef69d62ec2a8321eef7f27454bb0aa254765f5ffe5c819d47bf592cc48e","observation_id":"ad686d95-9820-434d-8f85-954a04ad2cb1","resolution":{"observed_at":"2026-08-07T05:22:23.919649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.581774Z","title":"Flows for simultaneous manifold learning and density estimation","venue":null,"work_id":"baf1bc7b-3159-4c9a-8c4e-953fb853dc6f","year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.989185Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:c09b28c6ec5dcbbf6166c820152f466e17f24f2810f473f2d580c8c0f65f6970","observation_id":"77b6dbda-ac72-4049-bbe7-f8caf6c48683","resolution":{"observed_at":"2026-08-07T05:22:28.586125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T05:22:24.040414Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.040414Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:ccd0a2ad2556c6909f49b15b1361c34c7320c34e7b33bdde27ef95c8a21a17bc","observation_id":"36370ff4-c1f4-4016-bb26-f32426d32543","resolution":{"observed_at":"2026-08-07T05:22:24.040414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.097958Z","title":"Bail: Best-action imitation learning for batch deep reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.097958Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:3fc0d0d540f6148dcc8ef5ddc79ece02315f5a0d5b188de75e5da9ae41502276","observation_id":"edfe8984-2ac4-41d4-864d-aa29aaf70d34","resolution":{"observed_at":"2026-08-07T05:22:24.097958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.557200Z","title":"Diffusion maps","venue":null,"work_id":"81642674-3023-456c-8634-be9bb9252242","year":2006},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.181646Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:7173db4715225dfea6e07bf13ba8f150b2d5d3c185d37515a54310209f1fa6c4","observation_id":"c13f2ac5-941f-4bbc-ae58-d7ee4c981374","resolution":{"observed_at":"2026-08-07T05:22:28.561407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.542676Z","title":"Pink noise is all you need: Colored noise exploration in deep reinforcement learning","venue":null,"work_id":"c62939dc-c0e0-4331-bbaf-f7058cb91092","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.256430Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:791eb4177ca84a44cd66a3f0cc817b84fbbb18fe6150b88ccf85f356e3b30c0d","observation_id":"46b1f972-6798-496f-a2c9-70fe477b9e2a","resolution":{"observed_at":"2026-08-07T05:22:28.547034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.311145Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.311145Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:c9852f546ab97f9b50aea80ac029ec9f59d712f4357c9ed5fc8095dcb2ff1652","observation_id":"e57d3fa9-29c9-4044-89e8-69d03c6d1aef","resolution":{"observed_at":"2026-08-07T05:22:24.311145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.517954Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"5b0349fe-9f8b-4981-8036-365607b8daa3","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.363317Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:c90b89a50fcdefe0f685c0dabecf57a720a1c61d731ea033dd41bd6c6a323c0b","observation_id":"7ae79ce4-115e-4677-9086-b1f6e9c8af6d","resolution":{"observed_at":"2026-08-07T05:22:28.522372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.503352Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"a43ed46c-b5f4-40f5-8891-17bbd6478998","year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.417323Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:cdc94b5bc4e5e73d57e22f1538f5edf1f549641ce05194027de4ccc274a93d22","observation_id":"423edc72-3bbc-4e63-a4cb-c285062e1a18","resolution":{"observed_at":"2026-08-07T05:22:28.507852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.488454Z","title":"Learning rankings via convex hull separation","venue":null,"work_id":"8dd444fb-2b9e-4ce6-a6e5-9de40134c175","year":2005},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.490677Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:624421de49e26483aecc4beb91624345344e94d1a773d9260c021ada079a3b81","observation_id":"01b87718-6770-47eb-be7a-7a426b0c7700","resolution":{"observed_at":"2026-08-07T05:22:28.493119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-13T13:09:03.918851Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T05:22:24.560434Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.560434Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:02ab05f65c7aca9a354c3e013bcafbc73c12dc9b6b14b8afdeed6f8e41dd5ae4","observation_id":"14dd046c-95d9-4c78-9362-9a3b7e400315","resolution":{"observed_at":"2026-08-07T05:22:24.560434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00321","last_updated":"2024-03-16T01:29:08Z","snapshot_observed_at":"2026-08-13T11:27:44.746650Z","submitted_at":"2023-06-01T03:36:06Z","title":"Improving Offline RL by Blending Heuristics","version":2},"cited_work":{"arxiv_id":"2306.00321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00321","snapshot_observed_at":"2026-08-07T05:22:28.055756Z","title":"Improving Offline RL by Blending Heuristics","venue":"cs.LG","work_id":"ec77ff87-37c4-4c6c-9e70-1f1a3e5e65ff","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.609399Z"},"links":{"cited_paper":"/paper/2306.00321","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:0bdfa2480e74a790085142aa09b278446dbc1b96c5d4e460895ef8d3df969fc0","observation_id":"0762145d-4da6-4aea-8d80-90ebb6106a89","resolution":{"observed_at":"2026-08-07T05:22:28.060732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.473449Z","title":"Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters","venue":null,"work_id":"4b5e6cc1-641e-4d33-9857-8414e839f233","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.668798Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9e470ec94b7cde6a335275c2c74b02e59a3f19360020be18c7bd0277080e6373","observation_id":"5c018bd8-872b-4025-8e05-9254dd4f0ef2","resolution":{"observed_at":"2026-08-07T05:22:28.478149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.748337Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.748337Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:ad2de08f37d45ba55bbf3965da75421f21d86106ebf8a552018aabfb879a6548","observation_id":"4e505ac3-d422-4752-b19e-2ae4a178802b","resolution":{"observed_at":"2026-08-07T05:22:24.748337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.447152Z","title":"Random projections for manifold learning","venue":null,"work_id":"0d4b37f4-76a1-4d34-b85e-0bd6f511581f","year":2007},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.810006Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:92f4a8bae115620feb5d0515f0041d4d8a462aee6c9e6b152ef42ef7d6f9cd39","observation_id":"087f99af-5649-49de-bd47-2c2e0f950ff8","resolution":{"observed_at":"2026-08-07T05:22:28.451972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.432100Z","title":"Beyond uniform sampling: Offline reinforcement learning with imbalanced datasets","venue":null,"work_id":"7002147b-2a3a-44b6-994c-1f772de1fb79","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.868522Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:26c7e328d903a5792fd3d825977dc2dc46c514ca38aa9411d2223d1cac662037","observation_id":"f174c80b-b129-4129-8507-7b5ac451a2dd","resolution":{"observed_at":"2026-08-07T05:22:28.436324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.417611Z","title":"Mild policy evaluation for offline actor--critic","venue":null,"work_id":"94dfa7f4-b849-460e-8f2e-368ac75163cb","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.941158Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:c6e2d12d6b27fa681537e9424bdaf42a5ce727a44c43e1a603d597c38d2da95e","observation_id":"7483e25c-d457-4a7d-85ad-9f0c26e589c7","resolution":{"observed_at":"2026-08-07T05:22:28.421916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07572","last_updated":"2020-02-10T08:39:09Z","snapshot_observed_at":"2026-08-11T05:45:22.192939Z","submitted_at":"2018-06-20T06:35:46Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07572","snapshot_observed_at":"2026-08-07T05:22:25.087828Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.087828Z"},"links":{"cited_paper":"/paper/1806.07572","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:a02950735a08e27c62cc6b4e7fe0f199ec96e79fb3daabee00389ec49a72c0b8","observation_id":"bb277ef5-c440-4243-8801-ae2ca4e47a57","resolution":{"observed_at":"2026-08-07T05:22:25.087828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.403148Z","title":"A convex hull-based data selection method for data driven models","venue":null,"work_id":"475d3d72-212e-4814-b37f-d9421f3cb298","year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.188248Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:d763cc1924f7ad5f2ac4fe47780347249c8935ba403f99615ee7a6ba4a7e54e3","observation_id":"0971bad8-7bec-440e-91f0-f6a9c4586f28","resolution":{"observed_at":"2026-08-07T05:22:28.407761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:22:25.300203Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.300203Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:404725ae8f1f46195a48e4eca5f42ded1f73fcae4c782ca27ae9c5ee2f39465b","observation_id":"b435e2c8-7c51-4615-a19b-45bfc93b67ce","resolution":{"observed_at":"2026-08-07T05:22:25.300203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.388227Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"744591c3-ad3e-478f-9328-9603a3e34e35","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.361489Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f6bcfd34b8d675da4c7173317963383e371b7ecd47ee4cb8c2ae65430a946c34","observation_id":"b4ac79f4-d8d5-4a13-8266-8afc8aabe59c","resolution":{"observed_at":"2026-08-07T05:22:28.392898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T05:22:25.460008Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.460008Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:4ac44494d52d18971939a6ef182ae7a81e1448ed950d97d22850318ea4b0fdd2","observation_id":"2796467c-3a3c-4708-a2c5-91d74746154e","resolution":{"observed_at":"2026-08-07T05:22:25.460008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.373570Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"3105225a-13ce-4581-a05a-25f0a0c53936","year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.549357Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f5418724cadf767d3532994c85c050e5fd3fc8af3aa35195d259bb0c2a0db458","observation_id":"950a4f7b-b3a5-4673-bf86-e4a380591bf4","resolution":{"observed_at":"2026-08-07T05:22:28.377984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:25.669895Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.669895Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f0e16c56210f9d107c56fecb9f75721e33f805bc790b38dd51d25e36c377b377","observation_id":"7acef59d-6aa9-4981-9cec-af33d8400982","resolution":{"observed_at":"2026-08-07T05:22:25.669895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18792","last_updated":"2024-05-29T06:17:33Z","snapshot_observed_at":"2026-08-12T23:55:30.116464Z","submitted_at":"2024-05-29T06:17:33Z","title":"Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies","version":1},"cited_work":{"arxiv_id":"2405.18792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18792","snapshot_observed_at":"2026-08-07T05:22:27.987495Z","title":"Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies","venue":"cs.LG","work_id":"80053d78-624a-4ed1-9b65-4f90e8414819","year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.764096Z"},"links":{"cited_paper":"/paper/2405.18792","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:98912519863aae99f61c6d21ed3e1e6ffdb75a8958f3f13ec3935678de9ba45f","observation_id":"8b551c13-6061-4f88-90c0-b6a1620cb95d","resolution":{"observed_at":"2026-08-07T05:22:27.992371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11027","last_updated":"2023-02-08T09:12:47Z","snapshot_observed_at":"2026-08-13T15:39:11.385175Z","submitted_at":"2022-05-23T04:01:11Z","title":"When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2205.11027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.11027","snapshot_observed_at":"2026-08-07T05:22:27.965503Z","title":"When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning","venue":"cs.LG","work_id":"6a8eed76-15cf-4115-b03b-f47294ca37b6","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.844016Z"},"links":{"cited_paper":"/paper/2205.11027","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:dffb9cf66c985a6ea4246ff2ba2a726d293ffdaba72746b03fd434f2086eff44","observation_id":"7a30ff04-8ad2-4ad5-a2df-3330feda9fd5","resolution":{"observed_at":"2026-08-07T05:22:27.971229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.347674Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"d03d1800-6786-491b-b19b-e4952e319181","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.916094Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:afea3753565cab9108c1a2a76df47d81a0b778ecd0f68ee65f167716579a603c","observation_id":"258495b4-b0ff-4cb4-99e9-f73d6b6800dc","resolution":{"observed_at":"2026-08-07T05:22:28.352784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03807","last_updated":"2024-02-21T05:24:37Z","snapshot_observed_at":"2026-08-14T01:22:51.790092Z","submitted_at":"2024-02-06T08:48:01Z","title":"SEABO: A Simple Search-Based Method for Offline Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03807","snapshot_observed_at":"2026-08-07T05:22:26.045813Z","title":"Seabo: A simple search-based method for offline imitation learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.045813Z"},"links":{"cited_paper":"/paper/2402.03807","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:af1829cda32bb1816680c99722c3465786ef43290457606abcc6422a69e68a4a","observation_id":"b067009a-5214-4801-85fc-419e7b097027","resolution":{"observed_at":"2026-08-07T05:22:26.045813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.332790Z","title":"On the role of general function approximation in offline reinforcement learning","venue":null,"work_id":"18019179-da49-4654-b4a8-fbee22192e19","year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.115252Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:2c7a08c25ee58791c85cd4e0116e254eb5ba786c17c9085f749a1e6f33f7d584","observation_id":"1196c970-65f4-4ac2-8829-4bdcd0bce33a","resolution":{"observed_at":"2026-08-07T05:22:28.337075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.318295Z","title":"Machine learning algorithm based on convex hull analysis","venue":null,"work_id":"93a98a34-c312-4a97-a5cd-be913b9f98de","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.203111Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:a232a00b5d3af75059f68928500ae4a24feba3a20624f815b4526547eea99b6e","observation_id":"3d6c7838-3c2c-4f35-874e-6992398433af","resolution":{"observed_at":"2026-08-07T05:22:28.322758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.00215","last_updated":"2017-06-13T15:54:51Z","snapshot_observed_at":"2026-08-10T05:15:06.916484Z","submitted_at":"2016-07-01T11:58:28Z","title":"Why is Posterior Sampling Better than Optimism for Reinforcement Learning?","version":3},"cited_work":{"arxiv_id":"1607.00215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.00215","snapshot_observed_at":"2026-08-07T05:22:27.927982Z","title":"Why is Posterior Sampling Better than Optimism for Reinforcement Learning?","venue":"stat.ML","work_id":"68b5a2e7-bb24-47aa-b17b-e92d37a6f2d1","year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.273819Z"},"links":{"cited_paper":"/paper/1607.00215","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9b044fe28ebfbb3d0b5d80397fa8a9c2bf6420d08ab8ccb1cff3ba74f7ac29db","observation_id":"44f94f89-08f2-41ca-be92-788441ea4c08","resolution":{"observed_at":"2026-08-07T05:22:27.932706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T05:22:26.320316Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.320316Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:349ae75df51b7ef0cc6070cf1ba2dfbdbd4d3cae7ceb2580ac753c2f536b1c30","observation_id":"e3c0c889-bdd8-436e-ba64-193c5f90571d","resolution":{"observed_at":"2026-08-07T05:22:26.320316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T05:22:26.393335Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.393335Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:b5e9508bbf371afee000d2f78325daf66034fd642fc0e4c78a806e552d19a4b9","observation_id":"4fbc39b4-afb8-4167-9a6f-cd1fdce17504","resolution":{"observed_at":"2026-08-07T05:22:26.393335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.303813Z","title":"Policy regularization with dataset constraint for offline reinforcement learning","venue":null,"work_id":"499550f7-eaab-454d-89c9-ddb37c297225","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.477113Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:120fdbb52dce752469df82e345a46b5fdf22d0f857976a099c183dbff4b16941","observation_id":"87e71b41-e966-446e-9f88-910d9bf76560","resolution":{"observed_at":"2026-08-07T05:22:28.308226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.289579Z","title":"Nonlinear dimensionality reduction by locally linear embedding","venue":null,"work_id":"f1de8f51-5a0c-42ab-af05-0af91b155843","year":2000},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.530029Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9a57806c09355fdfc5d56377da4828f88e2f148a73d3129d786b0f13116fc729","observation_id":"1e868df6-a8bb-44bf-9b57-e2a19a62e438","resolution":{"observed_at":"2026-08-07T05:22:28.293800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.275440Z","title":"A dataset perspective on offline reinforcement learning","venue":null,"work_id":"bb13683d-b9c1-4dd6-b386-cd487b9a4785","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.572723Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:4fab5edc937f1e676d49ed6d296ac4e1415aa7fa4591d4fc1fa2e6fbe4538040","observation_id":"e2562a35-92bd-4490-8447-166d9e165625","resolution":{"observed_at":"2026-08-07T05:22:28.279695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07747","last_updated":"2023-10-27T16:23:43Z","snapshot_observed_at":"2026-08-13T05:51:58.585291Z","submitted_at":"2023-10-11T17:20:32Z","title":"Accountability in Offline Reinforcement Learning: Explaining Decisions with a Corpus of Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07747","snapshot_observed_at":"2026-08-07T05:22:26.632916Z","title":"Accountability in offline reinforcement learning: Explaining decisions with a corpus of examples, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.632916Z"},"links":{"cited_paper":"/paper/2310.07747","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:1d908527958554f8e15449e913bca1dc6eb34441ff8fce2d894bcd00e8784ac1","observation_id":"5c6daea8-bc9b-4774-9770-09b969caaafe","resolution":{"observed_at":"2026-08-07T05:22:26.632916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:26.731486Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.731486Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:e52d86c07d8e8474d7560ae373f4bb842318c1f7541b38a9d6778858e6de856f","observation_id":"be1e0c20-24d3-4c46-9125-6725309df06d","resolution":{"observed_at":"2026-08-07T05:22:26.731486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.248856Z","title":"A global geometric framework for nonlinear dimensionality reduction","venue":null,"work_id":"e06960c2-0ef6-412c-aa43-09e0d4194b17","year":2000},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.777449Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:af4729876a5b82cfea1485c8a60c4b044393825f7512fd25c8f867f6196cd46d","observation_id":"bdf784a3-85fc-4a18-a1b8-10cce6db4427","resolution":{"observed_at":"2026-08-07T05:22:28.254341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:26.818469Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.818469Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:d6703e7d64ad1d7e9f296c79c26fa3f9be831e3542f5024f99955170428c1ce8","observation_id":"c3550023-30a5-4f75-860e-b65b43c43a7e","resolution":{"observed_at":"2026-08-07T05:22:26.818469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.233451Z","title":"Adaptive manifold learning","venue":null,"work_id":"8138a8e3-bc2a-42d8-b937-d84f8f2ae552","year":2004},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.909702Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f602fb2f459c5f4967f46169462007b2b72e2e26b52f928140a04dca6cf3fe88","observation_id":"97666142-1f76-4ba5-8747-d477965e14a5","resolution":{"observed_at":"2026-08-07T05:22:28.237822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.219092Z","title":"Improving generalization in reinforcement learning with mixture regularization","venue":null,"work_id":"aff7b514-e13b-4068-b36e-7659842aab8d","year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.975185Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:5e1fc216845dc52b76b3c268ea32469c7422451310f904b8c1b5e7471743a300","observation_id":"c32c712c-f7b1-4f43-826c-ec7805ae0790","resolution":{"observed_at":"2026-08-07T05:22:28.223654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.204607Z","title":"Exponentially weighted imitation learning for batched historical data","venue":null,"work_id":"a0463146-5a24-44f9-9c70-12c52fb6d222","year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.993358Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:7f9449830f2b4ed49caf261622fafa69aa803cf7e75948b52f0cbc9b1aedae5b","observation_id":"6b0d68aa-5d91-45a0-872b-69df93598980","resolution":{"observed_at":"2026-08-07T05:22:28.209242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T05:22:27.055708Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.055708Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:7dbd3f57e1005d6c7c7296837665d12fa1a9278631a0318d57433acc5a898cf0","observation_id":"77c722db-48ec-49f6-b92f-dfe28046357c","resolution":{"observed_at":"2026-08-07T05:22:27.055708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.190123Z","title":"Zeta hull pursuits: Learning nonconvex data hulls","venue":null,"work_id":"c73d7a8f-1599-4e5b-bde0-c562cc3b64a5","year":2014},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.159787Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:60794030c4b069171a131e5e409bbcf1cda757f2dfec8c53570a03a0d2764818","observation_id":"fbb913a5-e59d-418c-a15d-31470aad2381","resolution":{"observed_at":"2026-08-07T05:22:28.194510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.175461Z","title":"Uncertainty svm active learning algorithm based on convex hull and sample distance","venue":null,"work_id":"020795fb-3191-47f1-8a07-09bd8fc54216","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.217496Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9940404dbd770417301b2b0f23dd5e6d6d0fc212c01464a65cebf334c1d9cbfd","observation_id":"45f17633-9104-4ffd-9565-f2fa0d64e7c0","resolution":{"observed_at":"2026-08-07T05:22:28.179977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-13T12:15:03.518907Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T05:22:27.299725Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.299725Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:adcb682cdc0ec2fb8da6084896773b57e4ceb502eaf9ed5f0649c0a899f011d3","observation_id":"a73e2a5f-1b28-4238-8d50-5f4e3eb823c2","resolution":{"observed_at":"2026-08-07T05:22:27.299725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.402534Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.402534Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:820db18a31b71d3215d55cc5862855b5ba7e092efec7f688f216a30f7570bd6d","observation_id":"29ef1edb-2f09-4290-8ace-a5f42f6e7ef8","resolution":{"observed_at":"2026-08-07T05:22:27.402534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12955","last_updated":"2024-03-09T17:46:44Z","snapshot_observed_at":"2026-08-13T05:45:10.586629Z","submitted_at":"2023-10-19T17:54:39Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","version":3},"cited_work":{"arxiv_id":"2310.12955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12955","snapshot_observed_at":"2026-08-07T05:22:27.692509Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","venue":"cs.LG","work_id":"2f8a575f-a893-4163-887a-20f30d801211","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.451131Z"},"links":{"cited_paper":"/paper/2310.12955","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:0ea3b8d95c48b90e16e26e1a561ea5d40b545ae006ea37fb64a0df4157410ff4","observation_id":"a42cc906-eef6-49be-9a4f-edf5155a047b","resolution":{"observed_at":"2026-08-07T05:22:27.698977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.149999Z","title":"In-sample actor critic for offline reinforcement learning","venue":null,"work_id":"6a73fe35-0def-43f7-bcfd-9b76dd1cc576","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.547421Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:b17a26658c35dbb3e39278a256cd08a0b411f109aeb1852a3e9ed9bdff3dcba7","observation_id":"a0d3b574-9bee-46ee-8dc8-2945e3a3ccb4","resolution":{"observed_at":"2026-08-07T05:22:28.154600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.644839Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.644839Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:6284edeb3b2ab3bf3083a258324195dc85ed2a5b094d79b0a0fafe49d4f79b01","observation_id":"2572a492-724e-4fa6-94af-d2a55b0b8b92","resolution":{"observed_at":"2026-08-07T05:22:27.644839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.649510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.649510Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:a1ba4070b9fd9d9a3b011884a2f122063e87f1566c3cda8bd5537cf88fe52243","observation_id":"772415cc-6c2a-46be-9dac-6ee889b10779","resolution":{"observed_at":"2026-08-07T05:22:27.649510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.653919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.653919Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:3d6bf7899de50c76cc1b524e4f7a6f9e48d9ce5e6cd86bb22d0dd8af94486a4c","observation_id":"9b3481cc-3210-418a-a671-83b889d1099b","resolution":{"observed_at":"2026-08-07T05:22:27.653919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:05:32.939577Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":5,"verified_fuzzy":28},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.08417."}