{"as_of":"2026-08-17T16:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d780d94ee14fde4db45efb525d8656edf358c2336a2fe0914ec056c64094841d","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:37:53.152448Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15356/citation-record","integrity":"/paper/2507.15356/integrity","json":"/paper/2507.15356/citation-record.json","paper":"/paper/2507.15356"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-06T15:37:50.184495Z","title":"Is conditional generative modeling all you need for decision-making?arXiv preprint arXiv:2211.15657, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.184495Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:035408c0fb490ffe394babdcc3e33fbb2814dd5977adf780bfc5ae8250655245","observation_id":"a76a9418-e491-4598-86f4-58217c38bf00","resolution":{"observed_at":"2026-08-06T15:37:50.184495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:50.255255Z","title":"Decision transformer: Reinforcement learning via sequence modeling.Advances in neural information processing systems, 34:15084–15097, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.255255Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:e90a6a6cb99751a555f2e7f2645715833954296ac56ee1578b733f15677173f9","observation_id":"30860b91-1577-4040-985c-0b72487a98a8","resolution":{"observed_at":"2026-08-06T15:37:50.255255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.671575Z","title":"Bail: Best-action imitation learning for batch deep reinforcement learning.Advances in Neural Information Processing Systems, 33:18353–18363, 2020","venue":null,"work_id":"51552b08-08d7-4638-b97b-f629653da7ed","year":2020},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.332702Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:e0f4d13234b362e7a5c16269661e46e276941b5335cc755a0c5dbbffc882b721","observation_id":"d5c97db9-1a8e-44de-80b8-ca512574d786","resolution":{"observed_at":"2026-08-06T15:37:53.676212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:50.439573Z","title":"Semi-markov offline reinforcement learning for healthcare","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.439573Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:e1650a1aee104d110dee9db2f469105a7e7216e86b89ef13ad56f4f556084d23","observation_id":"47113f23-51c2-46fe-9590-5fe20bba8a3c","resolution":{"observed_at":"2026-08-06T15:37:50.439573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T15:37:50.561083Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.561083Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:9e75a1cb6ff68f05d77270cd20bfeef9acfa2e6917c9fa50775538d5fb5f6983","observation_id":"07fbdc61-538f-4b36-b0b2-7dcb7e3e48d8","resolution":{"observed_at":"2026-08-06T15:37:50.561083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.645875Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"e14a8469-85b5-4be2-87b3-c72477c080fb","year":2018},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.638152Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:45fb0947d51f7f8dcc49b6715c9d514567df516612809ffebd534bfe7db13adf","observation_id":"54ae3b4d-ee18-4c8a-b3c5-9c492e7bbd06","resolution":{"observed_at":"2026-08-06T15:37:53.650256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.630992Z","title":"Rediffuser: Reliable decision-making using a diffuser with confidence estimation","venue":null,"work_id":"b3384825-b71a-4378-9fa5-a282fde32488","year":2024},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.746400Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:0e3c0be4b53ca67332ef310dce34d9d8bfb139aa975677540dd37a27ba834d25","observation_id":"1cc395fd-3a72-403a-8c89-f4f84ef09c21","resolution":{"observed_at":"2026-08-06T15:37:53.635433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.615465Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"7502d0f8-a6fa-4feb-876f-ba6a996296a6","year":2020},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.864634Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:55a3daa07927c458704ef2f5c57627ee8e999c5994dcd69e43df902fc5f71ab9","observation_id":"fb909b41-48b6-4d68-957f-6c019ca2aae3","resolution":{"observed_at":"2026-08-06T15:37:53.620650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-17T05:09:53.121073Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-06T15:37:50.951988Z","title":"Planning with diffusion for flexible behavior synthesis.arXiv preprint arXiv:2205.09991, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:50.951988Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:b464ded61002ff98dba6641077f15479eb7cc261fe34759a30f023a0de8cf8fe","observation_id":"59d1e5b5-c75a-41dc-a1d9-9ee6e0b80539","resolution":{"observed_at":"2026-08-06T15:37:50.951988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:51.017352Z","title":"Offline reinforcement learning as one big sequence modeling problem.Advances in neural information processing systems, 34:1273–1286, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.017352Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:d7f8017ff80934c5dddc2608e20ee71dc4077e119e587e67a7aa5aee43fee295","observation_id":"7f78e584-f1cb-4e89-a48b-2ac6943d9ab1","resolution":{"observed_at":"2026-08-06T15:37:51.017352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08212","last_updated":"2021-04-27T20:06:33Z","snapshot_observed_at":"2026-08-16T18:31:02.806844Z","submitted_at":"2021-04-16T16:38:02Z","title":"MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08212","snapshot_observed_at":"2026-08-06T15:37:51.099837Z","title":"Mt-opt: Continuous multi-task robotic reinforcement learning at scale.arXiv preprint arXiv:2104.08212, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.099837Z"},"links":{"cited_paper":"/paper/2104.08212","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:14f64769b44efcd1da45ffe0b6a7d7029f74558eab18d45607d3cca77fc0b6a5","observation_id":"85c565e6-3faf-4e2d-bf89-871b02cc75e7","resolution":{"observed_at":"2026-08-06T15:37:51.099837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:51.194387Z","title":"Morel: Model-based offline reinforcement learning.Advances in neural information processing systems, 33:21810–21823, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.194387Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:41b73ac5e17462ec775ed4f59a4a0d44d5b876d3dd9f48a793b2956e6e8a5356","observation_id":"40859e80-6de1-459e-a428-baf474a65320","resolution":{"observed_at":"2026-08-06T15:37:51.194387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T15:37:51.282377Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.282377Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:4b8840988004b44b063dba004057b7aa8645a1a223628715b3210636960d79fd","observation_id":"43a1d839-1ac2-437c-b95a-ae85c13f853e","resolution":{"observed_at":"2026-08-06T15:37:51.282377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T15:37:51.370600Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.370600Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:d6cc320fec54542a0336d6beaf2131e863ec68f14376ce6a3a90fa300a65cde4","observation_id":"a1ba8dd4-94a7-4f26-b8c3-81f3c6cf6c5d","resolution":{"observed_at":"2026-08-06T15:37:51.370600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T15:37:51.477144Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.477144Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:e3a0ed0286b7d4cfb88129659b987583bf7abb44d49e4bf9597e3c398ec270e4","observation_id":"da7ba5ce-e97b-4969-8970-4aba80388222","resolution":{"observed_at":"2026-08-06T15:37:51.477144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.578977Z","title":"Ceil: Generalized contextual imitation learning.Advances in Neural Information Processing Systems, 36:75491–75516, 2023","venue":null,"work_id":"161ba61b-9878-43b6-8eef-b4ce8e8364e6","year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.596493Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:47f6905c78d7bc5bdd648f43f302f65e66963e176d6f9c118480ec3b28bd1fd7","observation_id":"b257feac-cb78-4411-86fc-7217bf60151a","resolution":{"observed_at":"2026-08-06T15:37:53.583922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:51.718497Z","title":"Synthetic experience replay","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.718497Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:17012a5e51f36986bb008ac36e883647ffbbda1f2e789b5ad9a240f07ebf5cf9","observation_id":"48859532-af26-4812-8077-3c8dc2db1d14","resolution":{"observed_at":"2026-08-06T15:37:51.718497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.553370Z","title":"Double check your state before trusting it: Confidence- aware bidirectional offline model-based imagination.Advances in Neural Information Processing Systems, 35:38218–38231, 2022","venue":null,"work_id":"2960e520-1c33-4962-8d44-f222452a5c8e","year":2022},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.816235Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:312b14c3f42c21c465bbbe26bea23b27052dae22c1f287cd332cd84d881f06fc","observation_id":"cce50624-81b0-4c45-bf06-4ee7df5b2a0c","resolution":{"observed_at":"2026-08-06T15:37:53.558361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T15:37:51.955819Z","title":"Awac: Accelerating online reinforcement learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:51.955819Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:07d44b3000fe9c699d9050d7f96b51b9bd68d33b168fb85d8790031ce3a670bd","observation_id":"911ad9aa-3fdb-4b84-92ad-a1fca77d468c","resolution":{"observed_at":"2026-08-06T15:37:51.955819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:52.031493Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems.IEEE Transactions on Neural Networks and Learning Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.031493Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:d5d0da3bf7ca527178afc47558fa7d633534cdfb4c8e40a884e3d561cf8558c3","observation_id":"fb06dcd3-7321-4184-945a-729cc75c9bca","resolution":{"observed_at":"2026-08-06T15:37:52.031493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07067","last_updated":"2021-11-02T01:57:22Z","snapshot_observed_at":"2026-08-16T17:49:29.464448Z","submitted_at":"2021-10-13T22:36:40Z","title":"Offline Reinforcement Learning for Autonomous Driving with Safety and Exploration Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07067","snapshot_observed_at":"2026-08-06T15:37:52.125198Z","title":"Offline reinforcement learning for autonomous driving with safety and exploration enhancement.arXiv preprint arXiv:2110.07067, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.125198Z"},"links":{"cited_paper":"/paper/2110.07067","citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:d60db7beb8d8e9957cd4c797b380ec06eee5ef4c767d23ce7b06ae1db06c35a9","observation_id":"06fe5f51-8a19-4daa-80b3-f52fa83f3fff","resolution":{"observed_at":"2026-08-06T15:37:52.125198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:52.224012Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.224012Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:d2405901f38c0ec4b49e7d172f6a876536621ecdb5a9fea82147d26edcaf5188","observation_id":"d14a4f0e-edc8-4391-a6eb-f0d1e84a2d5a","resolution":{"observed_at":"2026-08-06T15:37:52.224012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.517289Z","title":"Efficient exploration in continuous-time model-based reinforcement learning","venue":null,"work_id":"425310b6-399d-40c5-90d0-4950ff7a5c56","year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.316078Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:a7f7ff40530e443e5ee72c811ee39cc10bcf72ef14bb2e228e0ecd3683b6c659","observation_id":"d0a87f13-2e4f-42f8-b744-8985202f3e58","resolution":{"observed_at":"2026-08-06T15:37:53.521898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.501868Z","title":"Offline reinforcement learning with reverse model-based imagination.Advances in Neural Information Processing Systems, 34:29420–29432, 2021","venue":null,"work_id":"920df705-c361-4435-b4ae-2280e1d747ea","year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.441854Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:fab78dbbd47faab08ec555ba90f3a14f72117a3f0ab384e01f75d4f51fe936ff","observation_id":"03bdb8d9-ee11-4ff5-9c05-efa8396597c7","resolution":{"observed_at":"2026-08-06T15:37:53.506512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.486612Z","title":"Boot- strapped transformer for offline reinforcement learning","venue":null,"work_id":"92ab2df0-f0b5-433b-a54b-78ba723418f2","year":2022},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.619162Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:479e5c1fcad50665ab8210b6ea3a577fcf7aac4c344c90fed633f35cfb3ced09","observation_id":"fef7d80d-7fe6-4637-91e5-4d6c7920b2ff","resolution":{"observed_at":"2026-08-06T15:37:53.491225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:52.727678Z","title":"Critic regularized regression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.727678Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:23d763ad90552dab9f69462583da0bce700e6f7511287711947d09bb7670b92e","observation_id":"d97484b4-55e2-4324-a4a2-df35d918ce21","resolution":{"observed_at":"2026-08-06T15:37:52.727678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.460351Z","title":"Combo: Conservative offline model-based policy optimization","venue":null,"work_id":"67399c3e-6c12-413d-aa00-b4caf712df0d","year":2021},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:52.899938Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:31a785957c728eb5474d13c3cc2552686de7536c8f59b34e961ca977c31bf2c6","observation_id":"373773cd-e2a3-4955-a4e8-aa13b83c08dc","resolution":{"observed_at":"2026-08-06T15:37:53.465288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.000991Z","title":"Mopo: Model-based offline policy optimization.Advances in Neural Information Processing Systems, 33:14129–14142, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:53.000991Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:6ef8311588301bee85926aeb0dab600568f7bca4a3087667f48ad08ef33525c9","observation_id":"ad2f96c3-67bc-47dd-9753-81357462fe27","resolution":{"observed_at":"2026-08-06T15:37:53.000991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.434192Z","title":"Uncertainty-driven trajectory truncation for data augmentation in offline reinforcement learning","venue":null,"work_id":"36aa28d5-190d-42e5-a7d4-144001cbf719","year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:53.104913Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:15c207a07b563a818ee4575836120fb015dfb93abcd13747920eebec9ce94b81","observation_id":"147a32ca-1c0b-4248-983f-2c81921b4c16","resolution":{"observed_at":"2026-08-06T15:37:53.438931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:53.416407Z","title":"Decision stacks: Flexible reinforcement learning via modular generative models","venue":null,"work_id":"cb637666-322e-4878-aae2-007fa050d60b","year":2023},"citing_paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:37:53.152448Z"},"links":{"citing_paper":"/paper/2507.15356"},"observation_digest":"sha256:56b69a049edb07866d4caf34addab6f3b3e70574f6f6f4f52e67ca0c60cda93a","observation_id":"42708a2e-4d3b-4adb-b0ae-58386157e9d3","resolution":{"observed_at":"2026-08-06T15:37:53.422814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15356","last_updated":"2026-07-17T01:51:41Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T15:31:31.406962Z","submitted_at":"2025-07-21T08:08:18Z","title":"RAD: Retrieval High-quality Demonstrations to Enhance Decision-making"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2507.15356."}