{"as_of":"2026-08-10T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee09208f698c4d8866ce2f75f280ea43729522a02125cd8afa3339165b033636","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:22:57.334192Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06491/citation-record","integrity":"/paper/2502.06491/integrity","json":"/paper/2502.06491/citation-record.json","paper":"/paper/2502.06491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.739142Z","title":null,"venue":null,"work_id":"b51c6c1c-316d-43ae-90cb-1c2bf7504c06","year":2018},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.203760Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:7fc0d0c5ac6ff197197503025c0eb7afd4d0afaaa49d3baca36d99a8fa0327a9","observation_id":"026cb979-7686-4b92-8880-2ee95fe78810","resolution":{"observed_at":"2026-08-08T15:22:57.743081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.702173Z","title":"De- cision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"6b20ecf6-9ef2-4e5b-a29c-55b447a129ff","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.216414Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:9391fc1d4e96aa6af640a66c97ba893637ada36e25f7223af5fd798a02bcce9f","observation_id":"55d23ecb-21c4-4d8d-989e-ef35a4696425","resolution":{"observed_at":"2026-08-08T15:22:57.705723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11097","last_updated":"2022-06-28T09:54:03Z","snapshot_observed_at":"2026-07-06T12:10:46.147640Z","submitted_at":"2021-11-22T10:37:52Z","title":"UMBRELLA: Uncertainty-Aware Model-Based Offline Reinforcement Learning Leveraging Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11097","snapshot_observed_at":"2026-08-08T15:22:57.223190Z","title":"UMBRELLA: uncertainty-aware model-based offline re- inforcement learning leveraging planning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.223190Z"},"links":{"cited_paper":"/paper/2111.11097","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:bcd1497eb1b7ed11d6a3ff486592eb233d102e000896b1765a51cbb048125433","observation_id":"4269d9f1-b62e-46d1-bdca-f7fb7b3a5dd8","resolution":{"observed_at":"2026-08-08T15:22:57.223190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-08T15:22:57.226625Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.226625Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:2f2eb84cb45086fc98f85160ea498ddb541c4c1a533110e2ed5451aa8b2ac085","observation_id":"70be4e63-6abf-45d9-ab32-ecd9e84a69c1","resolution":{"observed_at":"2026-08-08T15:22:57.226625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.667285Z","title":"Bridging the data gap between training and inference for unsupervised neural machine translation","venue":null,"work_id":"efe39693-7644-4c79-b703-ced28054c3d3","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.235914Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:47d481d1bccf204032b40024d98fd13792a31cc53c7106a9e0f87725f1ab327f","observation_id":"29e74946-14b7-4ce1-95f6-9cd394fd2d09","resolution":{"observed_at":"2026-08-08T15:22:57.670597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.642128Z","title":"Offline reinforcement learning as one big se- quence modeling problem","venue":null,"work_id":"32c01905-4eb6-4a21-a184-047bd87df364","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.245241Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:7ad7c0f4873af1f13328513dd9177afce8cf8c4ee271198fec8032f593b5fad6","observation_id":"18f60e09-4984-470e-b489-ca6c1d27ce53","resolution":{"observed_at":"2026-08-08T15:22:57.645403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-08T15:22:57.248534Z","title":"Varshney, Caiming Xiong, and Richard Socher","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.248534Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:05e9c43123e593d2aa934f75bab547e4293ac5e5881e323f434d71b690890aae","observation_id":"6280b86b-f4ff-4442-9386-8508074da6a1","resolution":{"observed_at":"2026-08-08T15:22:57.248534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.633420Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":"a1ec1000-8f81-4bd9-be94-41b8241f523c","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.252753Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:400292396668ff34c7f92cf06cf388d3a00a4230c11c732934b1489400c03163","observation_id":"7f3a3ed9-5e91-4949-9333-ac83f829dc08","resolution":{"observed_at":"2026-08-08T15:22:57.636829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.624746Z","title":"Offline reinforcement learning with im- plicit q-learning","venue":null,"work_id":"574779c9-25b1-4e18-8d5c-861a2233e64f","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.256445Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:ce8745b83a11cc868954db72ef4630f253424115f639f921cae207802bf068dc","observation_id":"5c4afab4-e449-4a73-9b09-458d5cbbe853","resolution":{"observed_at":"2026-08-08T15:22:57.627969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.616343Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"2551aef2-baa8-4c24-84fb-56c7b350006e","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.259885Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:04cb086ca839bf951cdb9daf880cc4c6af841b2fc424941c130cf330517b82d0","observation_id":"41586ed2-9973-4f06-a537-f562519308fd","resolution":{"observed_at":"2026-08-08T15:22:57.619426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.607596Z","title":"Multi-game decision transformers","venue":null,"work_id":"59e66619-ad5c-4845-bd18-ca33de6ab55a","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.263329Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:d9af2fd61118ca4d3b308caea6de8fc0b09909c97572fa284fe590ea44a4c4f0","observation_id":"9a951ff5-7ddd-471d-a61b-333113962602","resolution":{"observed_at":"2026-08-08T15:22:57.611076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.598504Z","title":"Distribution- conditioned adversarial variational autoencoder for valid instrumental variable generation","venue":null,"work_id":"db12743e-550e-4302-80d9-f188bcc79c1f","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.266857Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:0c395817d203bb2f092692e63e9615b426d6c74da312225080db7ec9d90e7eed","observation_id":"717ee278-1cab-4ba7-832c-ac210c4d99b9","resolution":{"observed_at":"2026-08-08T15:22:57.601910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.589400Z","title":"Diffstitch: Boosting of- fline reinforcement learning with diffusion-based trajec- tory stitching","venue":null,"work_id":"6e9a686b-7186-42de-9bd6-b077515ddf66","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.270618Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:0c3a870f059454eda39fb835145010e46cc42512442adec1882022f2e329873a","observation_id":"92cd01e8-920c-40c4-be8c-f1d1247e33d2","resolution":{"observed_at":"2026-08-08T15:22:57.592871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.580620Z","title":"Ball, Yee Whye Teh, and Jack Parker-Holder","venue":null,"work_id":"48fa827c-8ede-451d-ba97-5e72f95cfcab","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.273848Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:20783662aa4889d447826f344c2dbda7b7214af965c07d6374c687a656ca01e7","observation_id":"c7f7a13b-1aec-4776-9d28-dcef19612457","resolution":{"observed_at":"2026-08-08T15:22:57.583625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.572111Z","title":"Luis, Alessandro G","venue":null,"work_id":"f4731067-e0af-4323-83ae-4a6c60cc10fc","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.277371Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:b2d2068daea89d17aaaa952de1b6451cf88060172440a8080fae35c2ea56cc90","observation_id":"fe2073c9-2ccb-4673-8f77-654dfba6d71c","resolution":{"observed_at":"2026-08-08T15:22:57.575212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.562372Z","title":"Double check your state before trusting it: Confidence- aware bidirectional offline model-based imagination","venue":null,"work_id":"97fd56b6-81f0-4658-8567-091970caf715","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.280821Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:5f0e85bd7e38ae6283df831e0b514a056bfba183a2a81e8a62219740234071e4","observation_id":"1950a005-210e-4aeb-96cf-7037685de849","resolution":{"observed_at":"2026-08-08T15:22:57.566186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.552895Z","title":"Reining generalization in offline re- inforcement learning via representation distinction","venue":null,"work_id":"42927bfa-42af-46f2-bc07-a1ac4e028122","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.284177Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:79e2bbbf490ac41106e6f3e0457bfec2dd61b2710261a21d8e9d47b0c47aab0f","observation_id":"61e7ecd6-f73c-4b00-9986-25798328309e","resolution":{"observed_at":"2026-08-08T15:22:57.556304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12550","last_updated":"2024-06-18T12:27:02Z","snapshot_observed_at":"2026-07-06T18:32:57.295918Z","submitted_at":"2024-06-18T12:27:02Z","title":"Offline Imitation Learning with Model-based Reverse Augmentation","version":1},"cited_work":{"arxiv_id":"2406.12550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12550","snapshot_observed_at":"2026-08-08T15:22:57.362446Z","title":"Offline Imitation Learning with Model-based Reverse Augmentation","venue":"cs.LG","work_id":"683db442-877b-4d37-9062-36595d53cb1f","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.287578Z"},"links":{"cited_paper":"/paper/2406.12550","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:80857d4bca876cb8d91769acdb43e906cadeaa01dd2da5b09cd82b3f71bde247","observation_id":"8c61a2e2-8a3a-498f-9eed-d19572ee22c4","resolution":{"observed_at":"2026-08-08T15:22:57.369429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.544020Z","title":"Model-bellman in- consistency for model-based offline reinforcement learn- ing","venue":null,"work_id":"b378e6bc-a04b-43e2-bdb2-ffd204cabdb3","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.291356Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:c53ee699b484a66aecff8fc692acdcfbd64e72ba3dca394a02af32c325d061ba","observation_id":"01e72fb7-2537-4b69-8fa2-00159d6e4547","resolution":{"observed_at":"2026-08-08T15:22:57.547316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.535108Z","title":null,"venue":null,"work_id":"d32d96ca-e928-4754-9747-da8d04014a9e","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.294834Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:dc6ad605d7fb0caf9175bd0dda30ff1648d8390cb5ac8b4a31e8941b80e6a640","observation_id":"c2d81fe2-a9c1-4f6d-8151-5914df624f47","resolution":{"observed_at":"2026-08-08T15:22:57.538430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.526017Z","title":"Self-correcting models for model-based reinforcement learning","venue":null,"work_id":"c827e6cc-fc1d-4514-aac9-79715743d9d6","year":2017},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.298237Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:dd80da359bf89f2b3b81c060311617b65942726cba921a7617bb7f4df9df7c24","observation_id":"15d7fb2a-a021-40a5-b218-a061e4b2056b","resolution":{"observed_at":"2026-08-08T15:22:57.529437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.304653Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9(11),","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.304653Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:de00ee78517073672add50d999ef453e34efe4044151de17e435dbe7f5c34056","observation_id":"b78e3e17-89ba-4638-b1eb-edf7f8c15c02","resolution":{"observed_at":"2026-08-08T15:22:57.304653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.491089Z","title":"Offline reinforcement learning with reverse model-based imagination","venue":null,"work_id":"42c79fc5-3d21-4858-8011-de342ba87143","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.310939Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:709b035e38029f0735ec29393e8b5836ba9c683ef9ea8c9120a133dabcd5c8f5","observation_id":"56d541da-ebea-4604-b467-bd85d01fe907","resolution":{"observed_at":"2026-08-08T15:22:57.495528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.481319Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional se- quence modelling in offline RL","venue":null,"work_id":"6c01552d-ede1-4870-8fce-eb0c538a4726","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.313868Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:4c2e83f0cf6aef9aed722ae6f73258b27af2056826aeb87e76cc85bde721e126","observation_id":"c4cb93a7-0fb8-41f1-81f3-58e809ab790d","resolution":{"observed_at":"2026-08-08T15:22:57.484638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.471670Z","title":"Pareto policy pool for model-based offline reinforcement learning","venue":null,"work_id":"09967b1a-a86f-451a-9553-278acd9fa3ed","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.316920Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:f92ad05cf59e583b64be0f2bdec14e0450472c622d2bae93bf59764ebe056e43","observation_id":"d188fd78-b098-42f4-8718-2de07b8da280","resolution":{"observed_at":"2026-08-08T15:22:57.475757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.460170Z","title":"Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma","venue":null,"work_id":"dc67eedd-29be-45c2-8909-44e61a86afd6","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.320106Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:997143b8fdd5e93ce3c404f9dbe030da8a29a97be6b98571cd0add55399ac707","observation_id":"cde9e3bd-eef7-43ed-8821-d20a5a4b7949","resolution":{"observed_at":"2026-08-08T15:22:57.464744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.448810Z","title":"Combo: Conservative offline model-based policy opti- mization","venue":null,"work_id":"5a9c9961-08af-4c01-91d0-706bfad77557","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.322865Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:3d464f50df19862357cd46809787089e25627659cbc8bf2937d668610349c362","observation_id":"0a3006d4-6613-4f3f-91c4-5dfd042a72a8","resolution":{"observed_at":"2026-08-08T15:22:57.453045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.438009Z","title":"Model-based offline planning with trajectory prun- ing","venue":null,"work_id":"c66704fe-f6c4-4538-bb00-0c6b53fbb6aa","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.325731Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:a5a3fce7f81275a55b1579625887b8c79e122b3d85590791fa46407120e6cc1a","observation_id":"4ec02951-1bfa-467f-8cb0-8740c0533f86","resolution":{"observed_at":"2026-08-08T15:22:57.442149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.426422Z","title":"Uncertainty-driven trajectory truncation for data augmen- tation in offline reinforcement learning","venue":null,"work_id":"428c5662-ff1d-47af-a0aa-d916b62f9348","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.328642Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:daaee11c6c88ad439f5d682f1748fa67042640d2bc244bd1661ebcc1f79293f6","observation_id":"c8406b5e-fd84-4b11-90de-47f9c3e0f528","resolution":{"observed_at":"2026-08-08T15:22:57.430685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.415092Z","title":"Conditional vari- ational autoencoder for sign language translation with cross-modal alignment","venue":null,"work_id":"5bd2b30c-4fdb-4caf-961b-3ded23482234","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.331555Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:9dafd510626e175684c483c1bbb55b343e2a233192ebf79b1573903655f3c8a0","observation_id":"c1b29786-5bdb-4317-9ae6-90c9dca0a147","resolution":{"observed_at":"2026-08-08T15:22:57.419360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.403406Z","title":"Is model ensemble necessary? model- based RL via a single model with lipschitz regularized value function","venue":null,"work_id":"826e846c-e19b-44aa-b8b8-dee8a4deacc3","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.334192Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:25850f2ece4b8d625e7c420a311bf2de8aa2d3e17e82172e41d90b0dbf6c2f22","observation_id":"13d9d2d0-9298-4b86-92c8-54bdfe8e946b","resolution":{"observed_at":"2026-08-08T15:22:57.407879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.501972Z","title":"Jamieson","venue":null,"work_id":"51d43929-7c73-450e-ad7e-e724d8af7514","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.307781Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:40ef24e252caa1a889648be5737cd4bbb2effae56c2c3f7bc1727c0c1987e75c","observation_id":"556ad3d2-8dce-4ba1-b319-0d167b3e30f2","resolution":{"observed_at":"2026-08-08T15:22:57.505853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.650592Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"5096a2ca-03bf-4163-aac3-9cb2dd6bc53c","year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.242035Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:1bee67fdfc4c7bc3d11e13bc0b8de1e281fdbdd74fb2bb9ef6a5e50c11a06fd2","observation_id":"a880dac2-8a39-4295-ad3c-93c285a6fd89","resolution":{"observed_at":"2026-08-08T15:22:57.653888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.516720Z","title":"Behavioral cloning from observation","venue":null,"work_id":"57518cb2-d296-457e-8467-c7d0a30737c3","year":2018},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.301527Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:f78348847cbfa776ce085510587ab5519528cf801297701a08b6a29c3e035fab","observation_id":"fc4a1364-2801-4845-9c84-56e87ae577b8","resolution":{"observed_at":"2026-08-08T15:22:57.520050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.729905Z","title":"Waypoint trans- former: Reinforcement learning via supervised learning with intermediate targets","venue":null,"work_id":"a53df1e9-6c9e-49b7-a660-29fe4d6fe0c1","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.207356Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:4ec302039c9b0bc36fc85da154d6bae972cd73b793bd493ed6324486dd370729","observation_id":"8c6bcd7a-3cab-481b-92bc-ee2992815790","resolution":{"observed_at":"2026-08-08T15:22:57.733466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.675637Z","title":"ACT: empowering decision transformer with dynamic program- ming via advantage conditioning","venue":null,"work_id":"07c8913e-c95d-413c-92fe-27ab0dcd2375","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.232925Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:3d10bdff1ab1a91f96aba65a13452b65f2d0dab8743d551b7d5fb1b8e00e5aa6","observation_id":"166a5bd9-fec1-4769-959d-2c9967232283","resolution":{"observed_at":"2026-08-08T15:22:57.679007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.683855Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"604090a4-cdd3-49f0-80b8-0c4f928bf145","year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.230025Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:907c40ff3ef1ab4fd02ae232cf553c590ce1574405153f863be9fcc04a3fd7e3","observation_id":"96854808-e76e-48ee-a68b-f5274a2c64e7","resolution":{"observed_at":"2026-08-08T15:22:57.687089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.692308Z","title":"Lapo: Latent-variable advantage-weighted policy optimization for offline rein- forcement learning","venue":null,"work_id":"6186806f-84c7-4541-b93a-ceec3af967dd","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.219766Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:ca9e6213ff086898ceb88b990aea25b39fc2d3ad563689eaccb77898dbbdc9dc","observation_id":"31eb5e0d-8161-47fc-a12a-57f08cbf02b9","resolution":{"observed_at":"2026-08-08T15:22:57.695616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.659177Z","title":null,"venue":null,"work_id":"150696f5-268f-4f96-b14b-9a707a7966b3","year":2010},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.239136Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:c9d65be3b62c0df79a9cc1fbd52ed91d09f5827ec621ebf5926e3edde344fdec","observation_id":"f3934870-e60d-4ca6-bc41-691e8e65e092","resolution":{"observed_at":"2026-08-08T15:22:57.662108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.721047Z","title":"Data-efficient task generalization via probabilistic model-based meta reinforcement learn- ing","venue":null,"work_id":"c063627f-6199-4d2f-bd01-a07732a9943d","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.210404Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:302a1e6837688686daa7da7d0572f2ac22bc68676f4f535ee88198a65bdf1420","observation_id":"56ec4d35-2a57-4f8c-8796-f22eeffb4fc8","resolution":{"observed_at":"2026-08-08T15:22:57.724076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.711740Z","title":"Blanchet, Miao Lu, Tong Zhang, and Han Zhong","venue":null,"work_id":"97cffed0-31e2-44be-ac53-96a4e3db198e","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.213411Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:b92e8fad10680533d63476068a1a269a2f40b447e8b175ef5fe1c36bfc179755","observation_id":"4b3ba3be-fe11-49f6-9117-8c0278e0b5c8","resolution":{"observed_at":"2026-08-08T15:22:57.715280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:15:02.509576Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.06491."}