{"as_of":"2026-08-16T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2810ee95931396aae1d94866081ea0b391b1e568753e9266c153a92cf2bf44be","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:23.355646Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21182/citation-record","integrity":"/paper/2505.21182/integrity","json":"/paper/2505.21182/citation-record.json","paper":"/paper/2505.21182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:27.004114Z","title":"Learning from negative feedback, or positive feedback or both","venue":null,"work_id":"8d830206-0db0-44c7-afa0-489311c2eb46","year":2025},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.474848Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:43e3fe4ace2b84717d2d1dc696fd05bb9d2b38c51042d2a6bc131ce250ab0eed","observation_id":"2c4628ce-86d1-4cff-8765-84ec7d88f045","resolution":{"observed_at":"2026-08-07T13:45:27.082515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.851515Z","title":"Ls-iq: Implicit reward regularization for inverse reinforcement learning","venue":null,"work_id":"738e89bf-e5c7-4dfa-b511-c0788493b44b","year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.546632Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6c20a85d51215890dd0f790bbb4eba0be7a79bb290b8dfbd142dc6550201cccb","observation_id":"64791b30-10ef-4627-999a-145bda6aa78a","resolution":{"observed_at":"2026-08-07T13:45:26.925023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03525","last_updated":"2020-08-08T13:43:06Z","snapshot_observed_at":"2026-08-14T15:07:33.005565Z","submitted_at":"2020-08-08T13:43:06Z","title":"Non-Adversarial Imitation Learning and its Connections to Adversarial Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.03525","snapshot_observed_at":"2026-08-07T13:45:20.621562Z","title":"Non-adversarial imitation learning and its connections to adversarial methods.arXiv preprint arXiv:2008.03525, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.621562Z"},"links":{"cited_paper":"/paper/2008.03525","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:96bb9c97e444c33a3072383bc2f669b15a1c2e9a275c492e1f1b55436fc568ff","observation_id":"205dd793-60b9-4425-8f25-4bd24ed16200","resolution":{"observed_at":"2026-08-07T13:45:20.621562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.707390Z","title":"Extrapolating beyond sub- optimal demonstrations via inverse reinforcement learning from observations","venue":null,"work_id":"d43eb40e-4413-435a-9866-4bbffe228044","year":2019},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.703436Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:5b2e2b774c0dc2ddc4fdea420992eb2acb606acdde0242d3161fb17e8122713f","observation_id":"1912d9ba-2283-44e0-a095-7e5dfd3e11fa","resolution":{"observed_at":"2026-08-07T13:45:26.765071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.779872Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.779872Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:8f0c883ea29898358779301af6c41d6f6c57bb3a65a0390c955d07db6f5b4ea3","observation_id":"2ff03470-5320-4fbd-8bb1-bfeb0b9a8d81","resolution":{"observed_at":"2026-08-07T13:45:20.779872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.857897Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.857897Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:139efbb34ebd22d521c7925dd1d06f1a8cb69c8a34400838011285ad4317ad34","observation_id":"9f2ea788-3d62-438b-88ee-8c8cc41ed391","resolution":{"observed_at":"2026-08-07T13:45:20.857897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.920843Z","title":"Learning robust rewards with adverserial inverse reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.920843Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:4796770906c436688188a626a711e851073823bc4c2d8d35e6fe2f710d1a87a7","observation_id":"f188ec89-2133-4a54-a83c-56d677b9d520","resolution":{"observed_at":"2026-08-07T13:45:20.920843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.555830Z","title":"Iq-learn: Inverse soft-q learning for imitation.Advances in Neural Information Processing Systems, 34:4028–4039, 2021","venue":null,"work_id":"9ea4d9b8-85a7-497c-bdf8-bd0e5290ac9f","year":2021},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:20.987020Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:55dfb8debcdc256cacea6a5a235267da915d326171390240ca8dca6c1276db1e","observation_id":"86f6ff67-01e4-47cf-b0ed-66feb0e9666e","resolution":{"observed_at":"2026-08-07T13:45:26.595388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.055628Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.055628Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:11550d7f0ece045149afdaeaae4d81101a88f91fb65c70cea84fba32a3c7eb38","observation_id":"d41efe19-f51f-4820-8ae0-df59e29f62bb","resolution":{"observed_at":"2026-08-07T13:45:21.055628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.109441Z","title":"Offline safe reinforcement learning using trajectory classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.109441Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:7d3fb68c5643d6697424a06bc96028ba466fc260549671413e45989893cd81b0","observation_id":"1348ed5c-b626-47c2-ab7a-4e0dd31a737d","resolution":{"observed_at":"2026-08-07T13:45:21.109441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.208925Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.208925Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:5e6f6664ca31522cf2df1f9cdd67114d552e0ab029cac8e763abd46aff98cb56","observation_id":"6e858749-43b9-4743-87e9-9156840f9d29","resolution":{"observed_at":"2026-08-07T13:45:21.208925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T13:45:21.257006Z","title":"Soft actor-critic algorithms and applications.arXiv preprint arXiv:1812.05905, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.257006Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:a9e701f968bf4026135d33c78c65e7dfed6d85a3060892e0bac36b7453012af0","observation_id":"ac492e48-001b-49a3-84c5-adc1112e90ac","resolution":{"observed_at":"2026-08-07T13:45:21.257006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.421722Z","title":"Inverse preference learning: Preference-based rl without a reward function.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"54e3074c-1c0e-4199-afd6-e4dcbde1fba9","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.308512Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:9165bad3ad57bb240e02028479c79a101312017f63d05b2ce08e041e52e05581","observation_id":"f529ed5b-29a9-4cd9-8198-801404ef02b1","resolution":{"observed_at":"2026-08-07T13:45:26.457263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.394551Z","title":"Generative adversarial imitation learning.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.394551Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:2c30dfcf5affc3437d348af8794ea1841e0303cf094f029d0887e855ad6acb76","observation_id":"52247b9e-19c1-4021-b86a-6b26c97c4c89","resolution":{"observed_at":"2026-08-07T13:45:21.394551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.275267Z","title":"Imitate the good and avoid the bad: An incremental approach to safe reinforcement learning","venue":null,"work_id":"29b7eba2-c4d3-466f-8809-aeb36e08299b","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.474304Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:ba57feb9549eaec51c017e6cea719c8fda1db25791a46aa4ae68a511bed86f06","observation_id":"4d50e597-f61d-4d14-9411-548562ffd556","resolution":{"observed_at":"2026-08-07T13:45:26.322307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:26.104199Z","title":"SPRINQL: Sub-optimal demonstrations driven offline imitation learning","venue":null,"work_id":"0b866c4a-a187-4569-94b3-d86f59bd6616","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.552971Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:c39d14979e63708111ecbdf3b7299b207d8abfae2afae9a5921dd4fd0b373071","observation_id":"18031182-88ee-4a67-8ca0-f491a21621ec","resolution":{"observed_at":"2026-08-07T13:45:26.199634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.986438Z","title":"Safedice: offline safe imitation learning with non-preferred demonstra- tions.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"79ad147c-bcfb-4f35-8faa-e6548a8a597e","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.625195Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:3923d63c423b0f0e138a6f79dbb170f35c4e6336ef27cc558bebac55f4c0fb42","observation_id":"901b9955-899b-4905-bd1f-374821406b14","resolution":{"observed_at":"2026-08-07T13:45:26.034700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.867644Z","title":"Beyond reward: Offline preference-guided policy optimization","venue":null,"work_id":"3981214f-93ea-4573-bf93-8d44c7853f15","year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.725329Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:c2723ca82b0acd2bf5d07a688647ff722b60d0fe459dd535f11899fee1f6f1f4","observation_id":"ebccd9e9-1a93-44c6-9eab-f3f86727b428","resolution":{"observed_at":"2026-08-07T13:45:25.922860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.745412Z","title":"Preference transformer: Modeling human preferences using transformers for rl","venue":null,"work_id":"7a16106f-f557-47e0-be3d-9b22b865d7c8","year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.776080Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:f1b8894c39708d10d937d74fefd45498136a50760e304ce980ceb6365d2da22f","observation_id":"7555e766-7186-488c-8900-13cc48bdb504","resolution":{"observed_at":"2026-08-07T13:45:25.802081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.622508Z","title":"Lobs- dice: Offline learning from observation via stationary distribution correction estimation.Ad- vances in Neural Information Processing Systems, 35:8252–8264, 2022","venue":null,"work_id":"5a55227c-489e-4a88-99a2-52ea91d092b4","year":2022},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.841038Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:e22939bab8b5d88db665c128e4e4ab208fe3c7ab0d89fd4a4650cac9321b9bdd","observation_id":"8c6f081a-5732-4def-a972-acfccd6b7c0e","resolution":{"observed_at":"2026-08-07T13:45:25.682139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.463347Z","title":"Demodice: Offline imitation learning with supplementary imperfect demonstrations","venue":null,"work_id":"494ed143-eb1c-429e-8b58-831a5ed88b76","year":2021},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.906581Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:9f944ad1ff7c2510e03302a002e0cd429f370f601e74373ce743b89bfda6c342","observation_id":"929132a5-0aa2-4164-98bd-73051ca1f061","resolution":{"observed_at":"2026-08-07T13:45:25.533048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.320556Z","title":"Imitation learning via off-policy distribu- tion matching","venue":null,"work_id":"00c2ece2-ce58-459d-bff1-31b3b5fc6b28","year":2020},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:21.998421Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6c5bc4949bba449b5a34bcc224d13737d34df980312e0e4b3773e767506afe03","observation_id":"bfa6dfa9-835d-4cee-bdb3-be81a1ea7a78","resolution":{"observed_at":"2026-08-07T13:45:25.377199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T13:45:22.055691Z","title":"Offline reinforcement learning with implicit q-learning.arXiv preprint arXiv:2110.06169, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.055691Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:5ad4bd31c8b002cbcc170d694d8652aaa79135ca1be36a33ce1b76c6a511963d","observation_id":"d7cd0d06-b351-4edb-9629-fd5a4efa2c3e","resolution":{"observed_at":"2026-08-07T13:45:22.055691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.126583Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.126583Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:7ee8fc5841ffac44f721fa90aea8a97d52ac8ee37f707d09d00dcac07c8310d0","observation_id":"c410392f-0d3c-49c1-8657-0c1196d72813","resolution":{"observed_at":"2026-08-07T13:45:22.126583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:25.155991Z","title":"Imitation learning from imperfection: Theoretical justifications and algorithms","venue":null,"work_id":"0ecda705-d797-4993-988a-de4801760ede","year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.191612Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:f0433401b13c37b5bf72798ab12de21005978f3b452b77cee25e8571eaf3b7fb","observation_id":"04ffb083-fa8c-4686-9284-074cbef611d2","resolution":{"observed_at":"2026-08-07T13:45:25.226569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.984987Z","title":"Semantic loss guided data efficient supervised fine tuning for safe responses in LLMs","venue":null,"work_id":"4127bb68-eb99-4cd1-aebe-b7d6483ad811","year":2025},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.244655Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:323e77c4fb35b69013174622086fe9820086ce5e29ccedf79a2080a621a32a00","observation_id":"4300174b-ee62-44f9-b5f0-eda6a886c6ce","resolution":{"observed_at":"2026-08-07T13:45:25.070431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.839157Z","title":"Versatile offline imitation from observations and examples via regularized state-occupancy matching","venue":null,"work_id":"b7b5bdc7-8c32-4b54-b7e1-37e878a34b60","year":2022},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.299475Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:a32465ca7073bf6c9c115110735a6d3bd27998ebfa05b83f6d3806d06ba9f561","observation_id":"424ddd85-30e7-4b83-a606-3b869189a8f4","resolution":{"observed_at":"2026-08-07T13:45:24.903313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.706700Z","title":"ODICE: Revealing the mystery of distribution correction estimation via orthogonal-gradient update","venue":null,"work_id":"0886d72e-1f89-4456-9942-3e6cfe09cb07","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.357370Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:a7015f0cbf44946edcd64508b0e8b185f08b8660c6616c50c9845bbdca78dfd8","observation_id":"fc3ca09a-e016-4aee-864b-8f1883a7923c","resolution":{"observed_at":"2026-08-07T13:45:24.765969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.428158Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.428158Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6d314a2483a338ac1f59c4568a4eff7bfa21ff4ac4c387173020c63b0a989436","observation_id":"30e0c133-e747-4e70-b5df-da0660b6d98f","resolution":{"observed_at":"2026-08-07T13:45:22.428158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.588618Z","title":"Learning multimodal rewards from rankings","venue":null,"work_id":"e2bd6cf2-820d-4a0f-b0d8-6fe1624afc8c","year":2022},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.483683Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:8115ddd10df6c1584e3e8b57423dff29802f996106d990aa105dd5a6797029e5","observation_id":"cee96929-d64e-44c2-92d4-d7c3dda9849d","resolution":{"observed_at":"2026-08-07T13:45:24.635468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-15T05:58:57.136637Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-07T13:45:22.530387Z","title":"Al- gaedice: Policy gradient from arbitrary experience.arXiv preprint arXiv:1912.02074, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.530387Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:173bd764414204247ee0a384fe0790260bb64eabf5a2d1382210d40e0e06fffc","observation_id":"8c0e79a4-3bab-4f99-8b9d-9ac36a579a56","resolution":{"observed_at":"2026-08-07T13:45:22.530387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.584986Z","title":"John Wiley & Sons, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.584986Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:e4371cee6f3471b430de631a62b9b8221bd156c32071f871fbe7894b3b9f5dab","observation_id":"ff04da8a-4818-467b-9f2a-93a3d7b4b752","resolution":{"observed_at":"2026-08-07T13:45:22.584986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11108","last_updated":"2019-09-25T18:44:47Z","snapshot_observed_at":"2026-08-14T16:26:02.784751Z","submitted_at":"2019-05-27T10:29:31Z","title":"SQIL: Imitation Learning via Reinforcement Learning with Sparse Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11108","snapshot_observed_at":"2026-08-07T13:45:22.644916Z","title":"Sqil: Imitation learning via reinforcement learning with sparse rewards.arXiv preprint arXiv:1905.11108, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.644916Z"},"links":{"cited_paper":"/paper/1905.11108","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:15eece45cd812ffbff2727ad30b1158b3ccb41e94d7d69171295dd765f024e51","observation_id":"adfc0d2e-f24c-41f9-a220-8b6384514e8b","resolution":{"observed_at":"2026-08-07T13:45:22.644916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.713611Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.713611Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:7cfe10b3673e060876c3f80382cc2b9eef8b9e03a15e20f2cf79f78a1ffd192a","observation_id":"2c709bc1-4fb8-4153-815e-febcac13d146","resolution":{"observed_at":"2026-08-07T13:45:22.713611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.413888Z","title":"Dual rl: Unification and new methods for reinforcement and imitation learning","venue":null,"work_id":"4cc49d5b-c985-40fe-a1b7-50d41ad62e7a","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.811006Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:332234bc6fd2426ecd882fd83f132de1788c04161e52c184c96ffe4108881e34","observation_id":"1baaf247-61f6-47a5-ae5f-0ac77832350a","resolution":{"observed_at":"2026-08-07T13:45:24.463802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-07T13:45:22.895040Z","title":"Value- decomposition networks for cooperative multi-agent learning.arXiv preprint arXiv:1706.05296, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.895040Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:511b081af0f527ab19c242e8bb83af54887250d2a99e9568c4e77813d30121cf","observation_id":"60918259-124d-4b73-b803-98d1a04efbdd","resolution":{"observed_at":"2026-08-07T13:45:22.895040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.948033Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:22.948033Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:1eb0de0a48e018641b777e563dc7271111cf80762335624c6984b1063a239dde","observation_id":"5c1093c0-bad7-441b-9fa6-b7006eeb0969","resolution":{"observed_at":"2026-08-07T13:45:22.948033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01954","last_updated":"2018-05-11T21:48:52Z","snapshot_observed_at":"2026-08-14T19:18:37.366856Z","submitted_at":"2018-05-04T22:36:58Z","title":"Behavioral Cloning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.01954","snapshot_observed_at":"2026-08-07T13:45:23.005235Z","title":"Behavioral cloning from observation.arXiv preprint arXiv:1805.01954, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.005235Z"},"links":{"cited_paper":"/paper/1805.01954","citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:52da4330a60bcb875b733b3362223f6ee06f3e60dfddab948aee2eec6bd20b7b","observation_id":"e6e1ccb1-e0e2-4803-9c4d-9ca5b907b114","resolution":{"observed_at":"2026-08-07T13:45:23.005235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.264833Z","title":"Imitation learning from imperfect demonstration","venue":null,"work_id":"0df1ab8e-46fa-4abe-b5f0-d69be9ff3d31","year":2019},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.063705Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:912d0c1e789102c1f22b8d4143a69a01ca1d4df178f7397234ed23a7d43a7329","observation_id":"9a076efa-b485-4645-923a-c19e040ddb10","resolution":{"observed_at":"2026-08-07T13:45:24.346386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:24.141140Z","title":"Discriminator-weighted offline imitation learning from suboptimal demonstrations","venue":null,"work_id":"bc535f24-5eab-44ba-a471-1d896674c8e6","year":2022},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.118107Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:585a2f7e3c6464af3e382831dbc491c3bbd1b02b7c6f1538dcfea5989df0a083","observation_id":"df5684c9-6a3e-42b4-8da1-9a4b96a64f1c","resolution":{"observed_at":"2026-08-07T13:45:24.184828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.999216Z","title":"How to leverage diverse demonstrations in offline imitation learning","venue":null,"work_id":"94115f05-252d-434e-80ef-18db5b1179ea","year":2024},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.181502Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6d96fe415d1a451f7ffee395ccd53f5c629bc4ffa0c50bedd275722599020af5","observation_id":"4b9daa03-61a6-495c-9682-1b5c4454e25c","resolution":{"observed_at":"2026-08-07T13:45:24.054467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.858182Z","title":"Confidence-aware imitation learning from demonstrations with varying optimality.Advances in Neural Information Pro- cessing Systems, 34:12340–12350, 2021","venue":null,"work_id":"897375e2-054e-43d9-ad32-35574fc50001","year":2021},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.235768Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6f0d58174ab5022bf0a9f84a86d269bc8cc3c3e2437de608d3aca899f8dc84c1","observation_id":"e736db86-5661-4b4c-b36d-6f2ba6a1e9fb","resolution":{"observed_at":"2026-08-07T13:45:23.927034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.301455Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.Robotics: Science and Systems XIX, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.301455Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:6ede7332a4558b82ac2390b568ae2c27d8306d8ebf432678a557a98c95d36f8f","observation_id":"79f27f97-9f66-46a0-95b4-3fc3ab98fc96","resolution":{"observed_at":"2026-08-07T13:45:23.301455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.601399Z","title":"The ingredients of real world robotic reinforcement learning","venue":null,"work_id":"7ee6f0e6-5069-47c5-aa74-83fdd8c0e34c","year":2020},"citing_paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:23.355646Z"},"links":{"citing_paper":"/paper/2505.21182"},"observation_digest":"sha256:f2db2b073fa98ad7b3b9eef0a999527b47cc427847993d622b953537430bc38d","observation_id":"2bc48ea3-2bd1-4766-9042-4b38461a3eaf","resolution":{"observed_at":"2026-08-07T13:45:23.733063Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21182","last_updated":"2025-05-27T13:33:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T22:29:51.887411Z","submitted_at":"2025-05-27T13:33:21Z","title":"Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2505.21182."}