{"as_of":"2026-08-09T21:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c324418e576fbdd5b8e924dd11362394673e60ffbcbd8fd63723c220e0b9697","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:21:29.435813Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19337/citation-record","integrity":"/paper/2505.19337/integrity","json":"/paper/2505.19337/citation-record.json","paper":"/paper/2505.19337"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:36.125456Z","title":"A review of reward functions for reinforcement learning in the context of autonomous driving","venue":null,"work_id":"198f5910-074e-43e6-9821-774f421826ff","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:24.932108Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:85c391ff2220fce09c31329802fb66a1e1f7e536c06bc48cec8b026d0bd6bf7d","observation_id":"ae52ad05-4262-4008-a82f-9c60562da714","resolution":{"observed_at":"2026-08-07T14:21:36.159398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:36.011188Z","title":"Hindsight experience replay","venue":null,"work_id":"452751cd-50e6-4e79-99ec-18473b7af9c5","year":2017},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:24.991707Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f207f5555d7dc5574808862a154188282e44c4074a2e42e35b45a241e8d1be5d","observation_id":"1495beaf-23bc-4b1f-8e60-3db0b9161aa0","resolution":{"observed_at":"2026-08-07T14:21:36.051685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01734","last_updated":"2024-03-04T05:20:57Z","snapshot_observed_at":"2026-07-06T17:38:59.580242Z","submitted_at":"2024-03-04T05:20:57Z","title":"Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy","version":1},"cited_work":{"arxiv_id":"2403.01734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01734","snapshot_observed_at":"2026-08-07T14:21:29.655906Z","title":"Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy","venue":"cs.RO","work_id":"11dd0eab-d21b-4ab4-a6bb-88c020a28599","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.084900Z"},"links":{"cited_paper":"/paper/2403.01734","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:da0d593091234821435a1b143375004473f4bf4d22fa98fb123835bbe661b12e","observation_id":"9c5b4ea9-7f87-4975-9c69-2d817661fef0","resolution":{"observed_at":"2026-08-07T14:21:29.770963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07749","last_updated":"2021-06-10T23:54:34Z","snapshot_observed_at":"2026-08-06T05:54:55.251384Z","submitted_at":"2021-04-15T20:10:11Z","title":"Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07749","snapshot_observed_at":"2026-08-07T14:21:25.121008Z","title":"Actionable models: Unsupervised offline reinforcement learning of robotic skills.arXiv preprint arXiv:2104.07749, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.121008Z"},"links":{"cited_paper":"/paper/2104.07749","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:19507f7914db03dd7ba15b46e84083d99a0cb1f0f1989a566b06739945237e7a","observation_id":"933a4504-06f1-4922-9b93-77336d51342f","resolution":{"observed_at":"2026-08-07T14:21:25.121008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-07T09:11:20.723647Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01345","snapshot_observed_at":"2026-08-07T14:21:25.163416Z","title":"Decision transformer: Reinforcement learning via sequence modeling.arXiv preprint arXiv:2106.01345, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.163416Z"},"links":{"cited_paper":"/paper/2106.01345","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:a1f88a825e9a8f6da71c8d7db6e91ec0431a60f8f3301228b57537ee52d1b0c2","observation_id":"d01ee715-bf00-4edb-909b-acfd60bf7f16","resolution":{"observed_at":"2026-08-07T14:21:25.163416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:25.216093Z","title":"Gymnasium robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.216093Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:97b73336067807cc89902a598ea20822ee2cc3c6d631e1437a3defeb670540e2","observation_id":"457babd5-5a2a-42f9-b215-a1b260f6e891","resolution":{"observed_at":"2026-08-07T14:21:25.216093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07568","last_updated":"2023-02-17T21:53:23Z","snapshot_observed_at":"2026-07-06T13:21:11.390008Z","submitted_at":"2022-06-15T14:34:15Z","title":"Contrastive Learning as Goal-Conditioned Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07568","snapshot_observed_at":"2026-08-07T14:21:25.312416Z","title":"Contrastive learning as goal-conditioned reinforcement learning.arXiv preprint arXiv:2206.07568, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.312416Z"},"links":{"cited_paper":"/paper/2206.07568","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:61e544c59f62ebc9747b5a4f7103203700e1d82d2de953a1f7dd268c178e2100","observation_id":"8bada3ed-c54a-4ff1-a252-9f16eeec7edf","resolution":{"observed_at":"2026-08-07T14:21:25.312416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.836051Z","title":"Safe multi-agent navigation guided by goal- conditioned safe reinforcement learning, 2025","venue":null,"work_id":"90af8866-b8af-4f04-8ad6-0db882b49b5f","year":2025},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.373485Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:14c1788ce956e14f24e1b85de7e2b77f535e40d13cbe748b38d6eea89e8c1205","observation_id":"5de72c4d-b6bf-4b36-a11f-df3dd372b951","resolution":{"observed_at":"2026-08-07T14:21:35.948907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.760407Z","title":"Curriculum reinforcement learning for complex reward functions","venue":null,"work_id":"912603bc-99c3-4d67-b35f-5b5e3162070c","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.413568Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:340cfd1620c290a3a73da674d1d85ca7bb4945f3c78db461a8be839fcf486c3d","observation_id":"7565752c-768f-4597-a351-4e6dc68adcab","resolution":{"observed_at":"2026-08-07T14:21:35.792698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:25.446509Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.446509Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:73b21b09c8359eccb40e500afe7e551a7e0991ab1e14a4413eb2da6a00fe8c73","observation_id":"4dff962f-8890-4939-bd0c-985c3d70ef3a","resolution":{"observed_at":"2026-08-07T14:21:25.446509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.669821Z","title":"Integrating domain knowledge for handling limited data in offline RL","venue":null,"work_id":"00b0619b-6fd6-4024-bdaf-fead803d1f59","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.528577Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:6adea96f8d5a0f265343f27ce9708970e7d7617764c4611fe469dd11246a8199","observation_id":"90562ba9-61e4-41f6-8a4f-6d9098548bb4","resolution":{"observed_at":"2026-08-07T14:21:35.704832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-08-08T14:57:05.363720Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-07T14:21:25.585866Z","title":"Learning to reach goals without reinforcement learning.ArXiv, abs/1912.06088, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.585866Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:7ff05e4a362a6de137430fd2c0d9d9bd1a3fc5f82d5e80351583e046d6882c5c","observation_id":"a2365892-1fd6-4786-9f4b-ca7f9256155e","resolution":{"observed_at":"2026-08-07T14:21:25.585866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:25.636687Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.636687Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:36ba8f975a3439b4eec328b9291189dde61630721ec274bf5b47f5aedb8aece4","observation_id":"9970028b-05b8-44f1-b722-08857b85e611","resolution":{"observed_at":"2026-08-07T14:21:25.636687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.571211Z","title":"Chemical reprogramming of human somatic cells to pluripotent stem cells.Nature, 605(7909):325–331, May 2022","venue":null,"work_id":"27a3cb3d-8e04-4269-be96-71c03c4331db","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.685668Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:0c6d79d8155289772dc4a10ddaa0ae20f903ccb1ddc30c0ede2440da9360c0eb","observation_id":"9b630f1c-0390-4132-9913-f3b28e69f4c0","resolution":{"observed_at":"2026-08-07T14:21:35.618483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.483034Z","title":"A boolean model of the cardiac gene regulatory network determining first and second heart field identity","venue":null,"work_id":"8d3437ef-f2c6-4ca2-b503-3aa8e3ad6a25","year":2012},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.765036Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:43a4ef9cd62f35aa97dac5958996a599d0394e2ea456b6c5f08b482ed2e28cfc","observation_id":"3dbeb6d6-8591-44b4-a41a-f01b776b3d6d","resolution":{"observed_at":"2026-08-07T14:21:35.510312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.405719Z","title":"Tomlin, and Jaime F","venue":null,"work_id":"4b00621e-c867-4e48-bbc8-1c1b6ce89853","year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.835613Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:950ee7404af82798c544019a5114c8f3f4caceda5b4e1646f3dcdef2b4a8a572","observation_id":"19a83738-c370-4fee-83f2-a72b0b7c191a","resolution":{"observed_at":"2026-08-07T14:21:35.439543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.311547Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"0816cfea-1d99-427c-9c20-8e0f603d010d","year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.870439Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:b6aaa652f95aa3b15cd98a5a611d68e40fb0c337d6f8cd67101e9484332eaf69","observation_id":"41d37acb-7049-474a-8f5d-645c98de102d","resolution":{"observed_at":"2026-08-07T14:21:35.333702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.271683Z","title":"Bradley Knox, Alessandro Allievi, Holger Banzhaf, Felix Schmitt, and Peter Stone","venue":null,"work_id":"6b2c01cf-17c7-4983-b83e-6afd5e73fba7","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.913074Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:89c463797d686c1455785634d6d4c941b1ee8032b6a7b4e481b141e25df418bf","observation_id":"a6ac1ca0-9b63-442a-b3b2-3336d349cf5f","resolution":{"observed_at":"2026-08-07T14:21:35.300791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.143880Z","title":"Bradley Knox and James MacGlashan","venue":null,"work_id":"82cd8515-743d-40e4-b3be-def38f93c740","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:25.958197Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:5d85263001bdb05ddb14956f263d14d182d5072cbc2b100d3ad3386466984304","observation_id":"070e12ce-7d13-4cf8-a63d-73078647b43c","resolution":{"observed_at":"2026-08-07T14:21:35.242897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:35.021429Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"b9385e61-e9ab-4fd7-a3f1-c1a434117a02","year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.027651Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f6cf51763ce1638452aa76de93acf3d425f59a644f300f56cf8bc605a784b6bd","observation_id":"fde16a3c-67aa-45f5-a778-05c824c8086e","resolution":{"observed_at":"2026-08-07T14:21:35.061773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.921594Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"2fe0c50a-74c0-404a-86de-008f119a9e6b","year":null},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.094429Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:393c896e388d5163f05d56492e3ebd0495b777515e613cc6d647660252dc881d","observation_id":"b3a8f137-4bd1-45fb-aafd-d451f660ee51","resolution":{"observed_at":"2026-08-07T14:21:34.984672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.831685Z","title":"Should i run offline reinforcement learning or behavioral cloning? InInternational Conference on Learning Representations, 2022","venue":null,"work_id":"f107bdf2-d924-47c2-92e0-5e6cc5ebca57","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.141209Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:4b6e12b27748d84e177fe844dac9d94846a9e93e273a8ebffe82cb3f000c9a3a","observation_id":"64f57ae5-f4a7-4a64-9bd3-0a61aa870116","resolution":{"observed_at":"2026-08-07T14:21:34.867017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.747854Z","title":"Batch policy learning under constraints","venue":null,"work_id":"7ef1ae4d-64ee-47bc-830d-099cfbadb5b2","year":2019},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.214577Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:375530c1189c59eba163aabb9a5b53385f7c6e2de9cde1525c6afdcb07890082","observation_id":"f615fdb4-b6e0-4481-b0ae-1381711316b9","resolution":{"observed_at":"2026-08-07T14:21:34.794039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.645413Z","title":"COptiDICE: Offline constrained reinforcement learning via stationary distribution correction estimation","venue":null,"work_id":"a458ba6e-3bac-46c2-98d5-1968cc28aabc","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.285379Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:bd8e90932da3b1ce1801c86069631b9cd9555438baa5ddaa4db5b27bdd87c673","observation_id":"29940060-8782-4a84-bcbe-a71e41b9ff96","resolution":{"observed_at":"2026-08-07T14:21:34.682331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.550785Z","title":"Possible strategies to reduce the tumorigenic risk of reprogrammed normal and cancer cells.Int","venue":null,"work_id":"a19ff0b2-a6c5-47b7-8174-17d4e013bd3c","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.370187Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:4794188752c07d9bd2ad0d39fa4d51ab2c9045a127a944585401a41cedb87af6","observation_id":"f6c4a3aa-cbd2-4447-9333-4b437eb5bc4e","resolution":{"observed_at":"2026-08-07T14:21:34.616390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:26.417572Z","title":"Datasets and benchmarks for offline safe reinforcement learning.Journal of Data-centric Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.417572Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:cdea191e17763060f858579ee0a065e08aaad1b3b96b7734d9f5beb0d6cab2a9","observation_id":"3d0b3000-3afe-42dd-8183-142dda00f2bd","resolution":{"observed_at":"2026-08-07T14:21:26.417572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.459684Z","title":"Learning latent plans from play.Conference on Robot Learning (CoRL), 2019","venue":null,"work_id":"b755574e-588e-4bc2-958b-93e9ec332152","year":2019},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.461167Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:6bd73bfcd7e25374ea56ec5b164b8099b3fc8a5a532dc37efb8ba955347d86e1","observation_id":"9e2f4673-99b0-41e4-be50-de20088c4880","resolution":{"observed_at":"2026-08-07T14:21:34.508157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.270991Z","title":"Offline goal-conditioned reinforcement learning via $f$-advantage regression","venue":null,"work_id":"82bbefe5-514b-41fa-952a-38802c15ea3d","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.536036Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:dc3473763cb0435fc1642ba7564e6ec830e96ab90a89f0313475f8f366c54eb5","observation_id":"19957aec-0bc0-4bf5-a110-ffb6ca7be307","resolution":{"observed_at":"2026-08-07T14:21:34.400791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.224764Z","title":"Offline reinforcement learning with domain-unlabeled data","venue":null,"work_id":"699d21c6-116f-43c3-bb72-6bf823078369","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.631423Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:87248c25a88703990bb1c3aa2c802860fafdfdbd41e70d0f65e7c77c35f12177","observation_id":"55ca60e0-2bd4-4da5-86fc-100ca10fd6ec","resolution":{"observed_at":"2026-08-07T14:21:34.236623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.170979Z","title":"Partial cellular reprogramming: A deep dive into an emerging rejuvenation technology.Aging Cell, 23(2):e14039, February 2024","venue":null,"work_id":"9d3448b1-9700-48fa-a3c0-333731d5885d","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.674719Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:fc90f452280709349784340bf93a61450237fa1b3c59d7a35ed2d66fda6b11f0","observation_id":"1e28bae9-e1bf-4a3f-8bdb-d59383ed5638","resolution":{"observed_at":"2026-08-07T14:21:34.199618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:34.003178Z","title":"Chemical reprogramming takes the fast lane.Cell Stem Cell, 30(4):335–337, April 2023","venue":null,"work_id":"c1f2508e-4c63-476c-9bf4-9798a9974c53","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.718658Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f67d4a0c9f374e6ea507b63c056905834462ba3cf7a47b43ef7ae224060e4f1a","observation_id":"1505f4c1-666a-4ab6-bb5e-5a148f875d0b","resolution":{"observed_at":"2026-08-07T14:21:34.059635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:26.828085Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.828085Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:32672200db3608907f7458343e2884e948d691b037462e6966e1323fd82db9a0","observation_id":"fc144620-7a11-4d54-b5d4-a820045f2eeb","resolution":{"observed_at":"2026-08-07T14:21:26.828085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.844237Z","title":"HIQL: Offline goal- conditioned RL with latent states as actions","venue":null,"work_id":"fb3b8a07-6c40-4300-ab6c-0512824d3ea6","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.912477Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f4c586acfb1d83e5628608b67e8884ee7d8469092ec1f3bffc3e58630f7d75b4","observation_id":"f16168be-be60-4fb6-9d09-e87d9224aff0","resolution":{"observed_at":"2026-08-07T14:21:33.941328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.720710Z","title":"Epigenetic reprogramming as a key to reverse ageing and increase longevity.Ageing Res","venue":null,"work_id":"41159544-4c68-457c-9259-da3276f22aa2","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:26.964931Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:fb1f313cc130ed7fdc858703a7e02160d07b369cd41ae644a5436c37a49bfe1d","observation_id":"3863d5e1-c4f1-480e-9a33-3a17062b9eb1","resolution":{"observed_at":"2026-08-07T14:21:33.772143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:27.035109Z","title":"Benchmarking Safe Exploration in Deep Reinforcement Learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.035109Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:141a12fad1fda795533b96b55d095c211e19c98fd4234204df2cb383b410ad62","observation_id":"c81ebcd8-9b26-41a0-90d5-05a1ab410a42","resolution":{"observed_at":"2026-08-07T14:21:27.035109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.555222Z","title":"Optimizing sequential gene expression modulation for cellular reprogramming - coupled boolean modeling and reinforcement learning based method","venue":null,"work_id":"57ef60d7-841e-4496-b2a0-c1d3fac60df3","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.153418Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:747dcd930b134747505e728a25c526298894f534138b4e7a25d515787eb388dc","observation_id":"0c29f1ad-9d93-4042-a881-897d0b151ce5","resolution":{"observed_at":"2026-08-07T14:21:33.626843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.417146Z","title":"Solving minimum-cost reach avoid using reinforcement learning","venue":null,"work_id":"d0ca3837-6389-4664-999e-5b92ad0b4702","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.204231Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:bd2d4c4629c27f7530c27b7b4d28d0061f3cc249e57853044a7ec8ace988187c","observation_id":"719c873d-b636-49ae-8ca9-83c0dc06cab5","resolution":{"observed_at":"2026-08-07T14:21:33.455537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.292538Z","title":"Responsive safety in reinforcement learning by PID lagrangian methods","venue":null,"work_id":"600c6ba7-79ec-4f7a-961b-1feda05296c8","year":2020},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.244936Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:eae49b78f72ef0b8e1c1741171da55e0dcd3e6a14e0284402d8e87bd3f169032","observation_id":"d198c106-36b2-43fc-bf20-ee396a656646","resolution":{"observed_at":"2026-08-07T14:21:33.354472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:33.126449Z","title":"Induction of pluripotent stem cells from mouse embryonic and adult fibroblast cultures by defined factors.Cell, 126(4):663–676, August 2006","venue":null,"work_id":"adfcc3f0-0bdf-4a20-bee3-74292fafc753","year":2006},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.332020Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:dbe1c278dbf4fb3b2f5429dd574471b28a6265a240f499e8ebdcbbf2f43e314b","observation_id":"22f5e84f-d15b-4419-998d-7b650fcd3c16","resolution":{"observed_at":"2026-08-07T14:21:33.169280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.974293Z","title":"Direct neuronal reprogramming: Bridging the gap between basic science and clinical application","venue":null,"work_id":"72dbbbd3-5a88-4270-a2d3-5b3d4e622e04","year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.430495Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:c9ff0175f2d107cd2939277660b6075fe49738a65479371c3a7f136e5d4337c3","observation_id":"81fc6768-94aa-4fd5-b5ba-dffb72dfc4dd","resolution":{"observed_at":"2026-08-07T14:21:33.046446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.741254Z","title":"Strategies and mechanisms of neuronal reprogramming.Brain Res","venue":null,"work_id":"10764928-244c-41e4-8db8-85787dcaabb9","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.552585Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:5e38889126f29b3c2551feb6722b78335b85dfb8867be08d0df75353c81cd670","observation_id":"a897a0c7-abd7-45af-acaf-cb2cb7a1331d","resolution":{"observed_at":"2026-08-07T14:21:32.851143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.595900Z","title":"Safe decision transformer with learning-based constraints","venue":null,"work_id":"11b955b1-3827-45f2-8a64-5532cf4cb21e","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.649651Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:1bce80372b1616a09bde7cf00e8ad885bea4d1b72f9a7ffe7bf9d1f41b4926ce","observation_id":"f5b567f7-8873-4b9a-8df8-4648b951a71c","resolution":{"observed_at":"2026-08-07T14:21:32.666599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.410791Z","title":"Elastic decision transformer","venue":null,"work_id":"2aa25838-f798-490b-9fdb-2a862bf279ff","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.751195Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f5d3ed92c2156565b1927438568793b134d8abbbe4f80df1b4864ab84a4f2db0","observation_id":"33e47295-9900-4203-ac32-39d4403a5549","resolution":{"observed_at":"2026-08-07T14:21:32.485416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.302269Z","title":"Prevention of tumor risk associated with the reprogramming of human pluripotent stem cells.J","venue":null,"work_id":"4a21db3d-6425-45f3-8264-4f0c5a900661","year":2020},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.829982Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:7d94fc60434a5f41c9c8e525e33c3cd6c8784c8b487b48ab925c698d8101a5c1","observation_id":"d6f17874-2bc7-4a92-b511-726a498cc945","resolution":{"observed_at":"2026-08-07T14:21:32.350234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:32.098228Z","title":"Constraints penalized q-learning for safe offline reinforcement learning.Proc","venue":null,"work_id":"09598082-4ff5-4787-a75b-2c426df723da","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.880716Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:6c60b5106e80a99403768acf22209aee7e2e5fbf7e3f7d756b8313d4aea734b6","observation_id":"ec8446de-a943-44b6-974b-92a2e14c78f0","resolution":{"observed_at":"2026-08-07T14:21:32.172365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.962473Z","title":"Joshua Tenenbaum, and Chuang Gan","venue":null,"work_id":"d162e437-64ec-40d3-8685-0375025869e2","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:27.974547Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:7de1e902dff125a4b578a683d08cc351529a86abe9de7aa4a34a0050feb2ea35","observation_id":"645f00e5-c53b-458b-a07e-601d437ed242","resolution":{"observed_at":"2026-08-07T14:21:32.014577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:28.122271Z","title":"Rethinking goal-conditioned supervised learning and its connection to offline RL","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.122271Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:a1aed8c4ed3b5b7b7089669a4a33c3c7ba1960d30cb1a9d053399622fc9077bd","observation_id":"a09187af-56c3-43c8-87dd-ddc1188ae56d","resolution":{"observed_at":"2026-08-07T14:21:28.122271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.763318Z","title":"Swapped goal-conditioned offline reinforcement learning","venue":null,"work_id":"7d967dd3-6831-4e7c-9c9d-56efeaf6f504","year":2023},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.248875Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:e1f9e3da0f0eb8909b437a54ab290c14fb1f9b12ce6f0b3317a18e63f7ceb0d9","observation_id":"aa775184-0685-471b-b5f0-9354e9cb721b","resolution":{"observed_at":"2026-08-07T14:21:31.829713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.615554Z","title":"Pre-trained multi-goal transformers with prompt optimization for efficient online adaptation","venue":null,"work_id":"bc8ee819-87c3-4475-ab18-3358ca47e278","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.327895Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:35cf33395733bf6df9caa8bda6ff28ec69b1e6188f53a3b4a85139518f4531db","observation_id":"364f41cf-dbec-44fa-af09-eebf4479af4b","resolution":{"observed_at":"2026-08-07T14:21:31.676433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05607","last_updated":"2022-07-13T04:21:26Z","snapshot_observed_at":"2026-07-06T12:36:48.652863Z","submitted_at":"2022-02-11T13:43:24Z","title":"Online Decision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05607","snapshot_observed_at":"2026-08-07T14:21:28.427899Z","title":"Online decision transformer.CoRR, abs/2202.05607, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.427899Z"},"links":{"cited_paper":"/paper/2202.05607","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:e1651591bf12597f01570a41effa1ec9f0f005b17cf0b9712c98e2d1c6d45b57","observation_id":"26d04b46-3e7c-471b-b2be-b6dac9ba78a6","resolution":{"observed_at":"2026-08-07T14:21:28.427899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.387595Z","title":"attempting","venue":null,"work_id":"dbc8a4ad-56f2-401f-ab5b-f0aa17b9110d","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.513558Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:61ae08de6680e61f7cf16d093756d0e1b8d3387a5372174279b29ee11a2af996","observation_id":"b0b4617a-db0e-4b89-849b-5180e6f0b2ad","resolution":{"observed_at":"2026-08-07T14:21:31.480166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.206929Z","title":"Constrained markov decision processes with total cost criteria: Occupation measures and primal LP.Math","venue":null,"work_id":"ddcb14b9-2699-4442-9256-27b8561b2235","year":1996},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.593570Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:88749e355982a74b8434d9de003a238897a63cb4a221b73226dad6ba4c7760ad","observation_id":"91714414-649b-4091-84e7-e04cc85556d9","resolution":{"observed_at":"2026-08-07T14:21:31.305262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.108012Z","title":"An efficient algorith for determining the convex hull of a finite planar set.Inf","venue":null,"work_id":"7dbfd9b7-6150-4bf9-a7c0-6fba8a7510ce","year":1972},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.735155Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:5bcb400e7c8883a756d2bebd86e1b92effad84d20eb0ab49ae652fb252b86968","observation_id":"c90cf0b8-f87b-4efb-a9bf-4f07173c00f7","resolution":{"observed_at":"2026-08-07T14:21:31.151567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:31.021388Z","title":"Cosine annealing with warmup for pytorch","venue":null,"work_id":"f1539e5b-5003-48da-b859-8705cc469939","year":2021},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.825129Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:86a75d6844c61d87f15fa0d93af054df9b5979a81c29bce9cb3befa615f2328d","observation_id":"3c4ae2a4-c47f-41a2-a97f-f7b787c03a27","resolution":{"observed_at":"2026-08-07T14:21:31.055318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.05118","last_updated":"2018-07-13T15:00:17Z","snapshot_observed_at":"2026-07-06T06:50:03.471843Z","submitted_at":"2018-07-13T15:00:17Z","title":"Tune: A Research Platform for Distributed Model Selection and Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.05118","snapshot_observed_at":"2026-08-07T14:21:28.915801Z","title":"Tune: A research platform for distributed model selection and training.arXiv preprint arXiv:1807.05118, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.915801Z"},"links":{"cited_paper":"/paper/1807.05118","citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f359ae1e36f58b2c0fa530517982e57b085eec3e03f3eff3e88ac1052a8d845d","observation_id":"fc3ae9f4-ed21-4f3f-a0fd-1ad405207a86","resolution":{"observed_at":"2026-08-07T14:21:28.915801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:30.901705Z","title":"A new concave hull algorithm and concaveness measure for n-dimensional datasets.Journal of Information Science and Engineering, 29:379–392, 03 2013","venue":null,"work_id":"713062cc-1af8-463a-9445-af40eae88835","year":2013},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:28.989109Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:f1a4f271f3a2a3ef0a4c68b52f17fa7581813686e710a589e44253e7f3fa6dcd","observation_id":"49aa24ea-f7f6-4f17-a854-2475887477c4","resolution":{"observed_at":"2026-08-07T14:21:30.950557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:29.069477Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:29.069477Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:c4022ce9fe95148922f1d66f498cd05b1e17e3f739d33b86e83b60c72bf5e63b","observation_id":"27de630f-f718-4b98-bc1a-2acde3be25cf","resolution":{"observed_at":"2026-08-07T14:21:29.069477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:30.688499Z","title":"Pay attention to what matters","venue":null,"work_id":"51f37b5b-091a-4c90-8fb6-dfe2e6345ff5","year":2024},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:29.159136Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:404b1c818e357fd7c51012c3b17263a24e5b666a1ddee410ff0ac425aec7836d","observation_id":"ee2c9eec-e71c-4554-afb9-ca7904b261f8","resolution":{"observed_at":"2026-08-07T14:21:30.825656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:30.441624Z","title":"concave_hull.https://github.com/cubao/concave_hull.git, 2022","venue":null,"work_id":"8196c8e0-a52d-4d9e-be88-72ceb6888f16","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:29.274220Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:5bfcbc762bfef5e1f0182f1cd9f4203f4d757c64644efabeeec7c428e82c65d6","observation_id":"d3273ad3-ad56-4f19-ada0-778141a333ca","resolution":{"observed_at":"2026-08-07T14:21:30.566152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:30.166198Z","title":"11th EAI International Conference, ICCASA 2022 Vinh Long, Vietnam, October 27–28, 2022 Proceedings.04 2023","venue":null,"work_id":"f6e532cc-0908-4c35-8eda-9ecf0b9fdbc1","year":2022},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:29.355717Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:84339dd32d09149735c2eb5ec1738acdbb954172ef11c1957efdcabb35164265","observation_id":"41df043f-01aa-43ac-b4bb-418911854e30","resolution":{"observed_at":"2026-08-07T14:21:30.322274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:21:29.928426Z","title":null,"venue":null,"work_id":"8bced5de-bcb2-4845-b4b4-cab826563ef7","year":2020},"citing_paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:29.435813Z"},"links":{"citing_paper":"/paper/2505.19337"},"observation_digest":"sha256:41de5148b61c788b1d2bbaaf2062e769b687868bb8b639ad8cd2f803aad1f56f","observation_id":"320e1e58-922e-4c2d-8f19-5b5401d74c1e","resolution":{"observed_at":"2026-08-07T14:21:30.024476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19337","last_updated":"2025-05-27T02:56:11Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:14:13.090409Z","submitted_at":"2025-05-25T22:00:38Z","title":"Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":45},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.19337."}