{"as_of":"2026-08-18T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e169a5f7db76c87c248f4134866bf431dd7fbfcd999703e30029f1de166184e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:28:16.326058Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:36:12.177892Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18160","snapshot_observed_at":"2026-08-01T12:36:12.177892Z","title":"Offline learning of controllable diverse behaviors.arXiv preprint arXiv:2504.18160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19523","last_updated":"2026-07-21T19:10:38Z","snapshot_observed_at":"2026-08-14T02:36:50.784733Z","submitted_at":"2026-07-21T19:10:38Z","title":"When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T12:36:12.177892Z"},"links":{"cited_paper":"/paper/2504.18160","citing_paper":"/paper/2607.19523"},"observation_digest":"sha256:3d5ad1a2333ce82ee355aff5a3e203543382e53ab2651537b6ade01a1d7a7f5b","observation_id":"62ae9cd7-9a10-4c82-ba49-9080037c237c","resolution":{"observed_at":"2026-08-01T12:36:12.177892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18160/citation-record","integrity":"/paper/2504.18160/integrity","json":"/paper/2504.18160/citation-record.json","paper":"/paper/2504.18160"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.815605Z","title":"Tenenbaum, Tommi S","venue":null,"work_id":"a7d7e036-012b-4176-a837-9ae0b3d2c899","year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.194332Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:39cba5365f3e108f7f57e49db86bed316c358b449d4f25a2af5dd20b0bb85874","observation_id":"46dc3da8-6009-4c4a-af39-8d0f03021353","resolution":{"observed_at":"2026-08-16T10:28:16.818801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.198338Z","title":"Testing, validation, and verification of robotic and autonomous systems: A systematic review","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.198338Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:f87c99e2ea62b0edfcb4360198f4ee483873380507192d76b164ec2f685f2c12","observation_id":"d94f85c7-da1e-4e97-a018-6624f513a8f1","resolution":{"observed_at":"2026-08-16T10:28:16.198338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.804903Z","title":"Champandard","venue":null,"work_id":"fed88a03-4efc-4800-8367-e1af949604b9","year":2003},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.202103Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:505f26ad8f387cb0c0ec7a054277e975dc5ccdf5254a66bbc50735313d256c81","observation_id":"75694176-20d2-4b57-97ba-ffd5c4ceadcc","resolution":{"observed_at":"2026-08-16T10:28:16.809260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.794550Z","title":"Decision transformer: Reinforcement learning via sequence modeling, 2021","venue":null,"work_id":"653a2c99-0c42-4a32-a6c4-a6407533bcab","year":2021},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.205553Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:4fcf1ef786081c0cdeeccb8d836969e9a39edda7d81b83daf93ec75505e9645e","observation_id":"29d0b07a-2bb0-4d81-b0aa-c2745a9a9d21","resolution":{"observed_at":"2026-08-16T10:28:16.798417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.209477Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.209477Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:798a533ecad4e09ea56ecaf0a0a27cafd61848d8e57f9f3beb8b09381385bc52","observation_id":"677b6835-8134-4494-9728-7abd941bf429","resolution":{"observed_at":"2026-08-16T10:28:16.209477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.212886Z","title":"Implicit behavioral cloning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.212886Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:8d5a16d4475c89d5d2dba9649813f175ef87a1e267668b9deeb27efa5926d698","observation_id":"806fdde5-3a9b-4be7-94bb-00ce85872741","resolution":{"observed_at":"2026-08-16T10:28:16.212886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.216548Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.216548Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:9c642f392d611e6941449c2c4dde0145ddc67a9e7261219f5e09f2d3aa6a276b","observation_id":"0953c5cd-3a7c-4463-9fac-f45d6a91b049","resolution":{"observed_at":"2026-08-16T10:28:16.216548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.763820Z","title":"Multi-modal imitation learning from unstructured demonstrations using generative adversarial nets, 2017","venue":null,"work_id":"e1ef5f0a-d462-46ff-94eb-aa29c061a696","year":2017},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.219985Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:de548d036bda1c28059ea9ecef89727181d82f8eeb17765fa56f0452aea20df6","observation_id":"a09e9538-4725-4bbc-bf54-38fb43b40b65","resolution":{"observed_at":"2026-08-16T10:28:16.767964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.751931Z","title":"Generative adversarial imitation learning, 2016","venue":null,"work_id":"d7caf8bf-9c9a-498f-8b47-b2a549beeaee","year":2016},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.223419Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:3daa98de4a00ef6b7fcccf3248fa7778675bb425f708e9622b69cf8f49ef4a87","observation_id":"30759a24-2d69-4c66-af40-f82e2d2d7d57","resolution":{"observed_at":"2026-08-16T10:28:16.756042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.738641Z","title":"ArtificialIntelligenceforGames","venue":null,"work_id":"12fa86c5-9fb2-4d32-896a-3ca80e18ce5f","year":2009},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.226687Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:2dcbf0b1ceda4df0c92da16dc60f7cb01fc5b72e24c63ba7edd3a93d9e5bcbf3","observation_id":"3c6a584c-cdd4-4cee-bdb4-f0ab0482104b","resolution":{"observed_at":"2026-08-16T10:28:16.743286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.229950Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.229950Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:a6ce4ff384547c20dcb00298bfa03eee7ef348bab4121d8531c7c14d61c1d44c","observation_id":"41bd42a6-83e8-49e5-8437-3633733ccdb3","resolution":{"observed_at":"2026-08-16T10:28:16.229950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.718833Z","title":"Tenenbaum, and Sergey Levine","venue":null,"work_id":"cde49978-1ab7-4145-964c-c418e934cd3d","year":2022},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.233360Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:1816ed39a74ad2527a78878691d25871d667b6177d5b1728bd429f8c05878c22","observation_id":"96968399-8ea5-41d2-9ad7-6c69e81f4142","resolution":{"observed_at":"2026-08-16T10:28:16.722532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.706133Z","title":"Towards diverse behaviors: A benchmark for imitation learning with human demonstrations, 2024","venue":null,"work_id":"c8880ab5-9d4d-49b9-a79e-9dbec0cd53c4","year":2024},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.236628Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:6380f8ce8125a84b79fb0ca82c52ef66be504e08f6bbafeda57a868a8ae9474d","observation_id":"70ecc02c-ea3e-41e2-8b8f-3e232cb958cd","resolution":{"observed_at":"2026-08-16T10:28:16.710539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.239819Z","title":"Offline reinforcement learning with implicit q-learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.239819Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:0aac398eaf81919748a0448f228d72729aaf97090f4d3419f320c9af09fc6f44","observation_id":"aa1b326c-bf1a-4638-9289-7951864c66e1","resolution":{"observed_at":"2026-08-16T10:28:16.239819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.686436Z","title":"Conservative q-learning for offline reinforcement learning, 2020","venue":null,"work_id":"aadfe2bd-12ba-4486-b805-4515f1d8a35d","year":2020},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.242854Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:0a0f9c97fc13590713eb65e3ffa389ebb7fcc2780e6ad873df66b4ddbd6540c4","observation_id":"81c57388-98f0-4765-9981-4bf24cf02e82","resolution":{"observed_at":"2026-08-16T10:28:16.690906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.674151Z","title":"When should we prefer offline reinforcement learning over behavioral cloning?, 2022","venue":null,"work_id":"003be88f-9348-4c93-820c-d16512f8088c","year":2022},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.246014Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:86351faf9120f686da12dafbac106a63387b22dba0af054d36d858e86b405f06","observation_id":"7ace76f2-8dca-4388-99b4-7c1dd7ef7e5f","resolution":{"observed_at":"2026-08-16T10:28:16.678245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.249328Z","title":"Human-level ai’s killer application: Interactive computer games","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.249328Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:84a49e77570f2f6eca4e4880e4c3a08570e880c6fb4f5c2fac813ab7fb4d728b","observation_id":"b7a876c2-4689-4c94-b62a-cb78e193429d","resolution":{"observed_at":"2026-08-16T10:28:16.249328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.662595Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery, 2022","venue":null,"work_id":"c4e6ed04-8851-4c32-8ee4-846afdaf962f","year":2022},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.252605Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:94cd81704c9a24a6a67a070633866864d7bed5442f800ba83a2e89b04c68c333","observation_id":"7417b1a5-a62f-4145-9588-54006e4cd578","resolution":{"observed_at":"2026-08-16T10:28:16.667157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.649210Z","title":"Infogail: Interpretable imitation learning from visual demonstrations, 2017","venue":null,"work_id":"2a4caca2-3b4e-478f-b6f8-d0f07804bba1","year":2017},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.255737Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:c89ecd190c279ecc3303cef1eacee6a8b20e6c23d277e240a46e913a51e6b037","observation_id":"fd3eb4a2-5eb3-4cbe-9aa3-c833f28ac8ee","resolution":{"observed_at":"2026-08-16T10:28:16.653531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.638827Z","title":"What matters in learning from offline human demonstrations for robot manipulation, 2021","venue":null,"work_id":"e3d34b81-814c-4409-aefe-be027c0a9e87","year":2021},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.259013Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:df02817ade04fcffc0e961125dee681842728af89b9c3b62eecdbca0deff04ad","observation_id":"be3534d8-099c-419e-9ff4-8f7b4e999e2d","resolution":{"observed_at":"2026-08-16T10:28:16.642839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.627371Z","title":"Stylized offline reinforcement learning: Extracting diverse high-quality behaviors from heterogeneous datasets","venue":null,"work_id":"6873b3f6-0a4b-4016-9c79-c92126278713","year":2024},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.262412Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:3bd3b95425ca83c069e64d8d9ff19cb4658ef5133b9b116248e2ebc99c8c550a","observation_id":"99228e55-36e6-4003-b741-8d1e1ef89f24","resolution":{"observed_at":"2026-08-16T10:28:16.631729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.614547Z","title":"Behavioral Mathematics for Game AI","venue":null,"work_id":"c3954f5a-7e6f-4e63-acdd-df192973ab47","year":2009},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.265486Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:ff7cacdb6d27831078bed9cf831cf8b20324e30200ddcfd6f7daf10de96b3bf4","observation_id":"97acf20e-55e4-4883-a99d-d8a839750e9e","resolution":{"observed_at":"2026-08-16T10:28:16.618992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.602652Z","title":"Three states and a plan: The a.i","venue":null,"work_id":"61038d0a-cea1-4f6b-907a-4b653e7c5c11","year":2006},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.268571Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:98fec40736e5724a6c6fce706b0630441d7c926ed9f4e22de20ac49b31008d26","observation_id":"3dc502c1-1d7e-411f-90db-0f42da0ffacb","resolution":{"observed_at":"2026-08-16T10:28:16.606400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.271870Z","title":"Imitating human behaviour with diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.271870Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:32155024f7934236d874d555ada44a6ba823641476bb966fb5d23c7c588e679d","observation_id":"b54f62dd-7fe2-4ce8-8496-4a741e9a815e","resolution":{"observed_at":"2026-08-16T10:28:16.271870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.580948Z","title":"Pomerleau","venue":null,"work_id":"9ca88715-a9a9-4772-ae47-86c720e52501","year":1988},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.275279Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:da054390e31f65707fd5219e2f3abbd139ce04612d1317c5d93c974c02cead7f","observation_id":"4bf5aac0-a10a-412f-af32-3338b3a11e68","resolution":{"observed_at":"2026-08-16T10:28:16.585525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.278429Z","title":"Goal-conditioned imitation learning using score-based diffusion policies, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.278429Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:8bc9b5348071a9e9100578058a6cdc5d2a47eef3b30e0838e58cbf54baf2d3d4","observation_id":"75bce0af-0add-40f5-817a-b847e25a177f","resolution":{"observed_at":"2026-08-16T10:28:16.278429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.558934Z","title":"Artificial Intelligence: A Modern Approach","venue":null,"work_id":"c46f8195-88c1-424b-b2b7-f1fbbc5bef51","year":2016},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.281800Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:5f0fccd23c409c0df9142be998a0948b9489f31d796fe5b26a3ad7187ffdb353","observation_id":"a62b62cb-de44-46b8-aeda-95dd382d1fa7","resolution":{"observed_at":"2026-08-16T10:28:16.564457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.284915Z","title":"Behavior transformers: Cloning k modes with one stone, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.284915Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:f11ca2e4c21fa8b670a3e7fc3636ef4ab779726fcb014c344c68558ba0460c59","observation_id":"d12c0e44-e2a1-43ff-a5b9-e4f346195735","resolution":{"observed_at":"2026-08-16T10:28:16.284915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.539901Z","title":"A mathematical theory of communication","venue":null,"work_id":"41e0998a-7035-469d-9e5b-f961206591b9","year":1948},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.288357Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:1e383df96c1959763a348a6fc5d6ddec31ad68e0e39583cdaeb416e3f8a845ac","observation_id":"3295ec91-7198-4626-afaf-8f8ea7743146","resolution":{"observed_at":"2026-08-16T10:28:16.543040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.527512Z","title":"Diverse behavior is what game ai needs: Generating varied human-like playing styles using evolutionary multi-objective deep reinforcement learning, 2020","venue":null,"work_id":"fba19c77-7249-4c86-ab14-025e62b83e81","year":2020},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.291853Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:5ff3dbd583335d5d6ef9d0b422b96ed59f5f996d3af88eebb530d7f59a3e24da","observation_id":"fd4e0919-0d39-4389-8edc-e607fc787cd2","resolution":{"observed_at":"2026-08-16T10:28:16.531677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.517172Z","title":"Skill decision transformer, 2023","venue":null,"work_id":"2c6e3130-c3aa-40d4-acf7-7cd915184ee8","year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.294913Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:b146dbfd57a1d4a3778fd33c3fee8a0b95bdcbe4b8914623cc402e3eab50fde4","observation_id":"3c9df94a-e6ec-4e6b-b5d5-cade8256946b","resolution":{"observed_at":"2026-08-16T10:28:16.520841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.298184Z","title":"A note on the evaluation of generative models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.298184Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:79613d6cb92b1cd815e54b1b40238de642a5e7349246f8624fbae168bbd0bfbc","observation_id":"c16693e5-94de-4bcc-936d-9d34e356db7f","resolution":{"observed_at":"2026-08-16T10:28:16.298184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.499625Z","title":"Braviner, Panteha Naderian, Chris J","venue":null,"work_id":"f9023724-43b1-4039-931d-b171c5eaf068","year":2022},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.301529Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:471f5ad2ba66501ece7a16e88723e624a6cde607b23164ab4a58f1b8ac88a484","observation_id":"3a41362b-78d4-49a6-997a-e68ed080dc1d","resolution":{"observed_at":"2026-08-16T10:28:16.503524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.488718Z","title":"Robust imitation of diverse behaviors, 2017","venue":null,"work_id":"99133422-9095-41e9-8b6b-4a63af8239b2","year":2017},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.304586Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:9dfad174593dfb5f851977fdc99e5c5e8be364e6eaf8b87d165584aa8ba72958","observation_id":"153f1c95-98b0-444d-b0f0-23afce40b45d","resolution":{"observed_at":"2026-08-16T10:28:16.492499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.475435Z","title":"Diverse policies recovering via pointwise mutual information weighted imitation learning","venue":null,"work_id":"3c3c5698-891f-4af2-be68-52d9c278a679","year":2025},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.307723Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:4390224b1db059a17da86b453bb292b8c77ac8f4427f4af4d384bc2721080b95","observation_id":"f13976e7-4bca-4154-992d-164f467843ae","resolution":{"observed_at":"2026-08-16T10:28:16.481318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.311023Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.311023Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:c05f2194bbe023a0fc2abb3c07b8ad886014eb7d828d4d6e1b8b918af2d5c3d9","observation_id":"d71bee41-b59d-4b80-bb59-e21ed30f1f03","resolution":{"observed_at":"2026-08-16T10:28:16.311023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.314234Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.314234Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:fe57096e004ea72a5fece2a070d906a969f321a63a187e2d6bd8f0a4e652d8e0","observation_id":"242579c5-806e-48f2-87b1-d953bae54ea9","resolution":{"observed_at":"2026-08-16T10:28:16.314234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.318479Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.318479Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:8c47beabd9456d389f553382de4e59452469e216b326c696bd144d71cb8925c1","observation_id":"9088d9d2-0943-4710-952c-867cb64beb36","resolution":{"observed_at":"2026-08-16T10:28:16.318479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.322335Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.322335Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:435c91133d094253c63d5265ad0382153c24963c653fff0b14e2a2aa81e08f68","observation_id":"41ed44f3-f1f2-4c2d-900e-f3e37ace2b32","resolution":{"observed_at":"2026-08-16T10:28:16.322335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:28:16.326058Z","title":"For robotics, learning from human experts allows to reach human-level performance without any controller hard coding or expensive interaction with simulated or real environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:28:16.326058Z"},"links":{"citing_paper":"/paper/2504.18160"},"observation_digest":"sha256:30b0a60815bda196d88add6bf6c3a0bb712a7d8cde92746544c4e2092f46322e","observation_id":"9decf6ca-2c54-469c-84c5-1e1332b4bb65","resolution":{"observed_at":"2026-08-16T10:28:16.326058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18160","last_updated":"2025-04-25T08:16:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:20:39.843519Z","submitted_at":"2025-04-25T08:16:56Z","title":"Offline Learning of Controllable Diverse Behaviors"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2504.18160."}