{"as_of":"2026-08-11T14:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d8b93e7a8a108baaff4a27af46eb1c039673ee1bcc24186e33a1e0803d04fe5","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:42:58.448782Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.03013/citation-record","integrity":"/paper/2510.03013/integrity","json":"/paper/2510.03013/citation-record.json","paper":"/paper/2510.03013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.390965Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.390965Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:f01bb7f938943f5f2caa3c5ea1b6698ef2959954d267a038be61eb5a7e30c08c","observation_id":"5b5898a2-9e6e-4207-8cff-c45924fdaa44","resolution":{"observed_at":"2026-08-04T12:42:55.390965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.494235Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.494235Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6ecbd6ab97aaeba08a2058b84d67133fd108eba4c6ce805fddc5eb5c0cb4f614","observation_id":"4b8df049-d540-41cd-a937-bab4baf90072","resolution":{"observed_at":"2026-08-04T12:42:55.494235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.585972Z","title":"A survey of inverse reinforcement learning: Challenges, methods and progress","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.585972Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:9d2667a11343f57410edced8c8202ece26974fad6b081af33ca7f8f93b8a2d48","observation_id":"951c8b6d-31ed-4378-b53e-f4530b549d7c","resolution":{"observed_at":"2026-08-04T12:42:55.585972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.641301Z","title":"Dynamic inverse reinforcement learning for characterizing animal behavior","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.641301Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:9bdaac9a0e529c53897902e7f62b1276d085227c3e8e5724f67c5c4e4bd69985","observation_id":"dc68dd71-a32f-46d9-9dfa-14bdeae8aa38","resolution":{"observed_at":"2026-08-04T12:42:55.641301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.700567Z","title":"The multivariate skew-normal distribution","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.700567Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a9268105e68e765dbcc67560868bbba9e62f25c70a3e3fc3e13d9ec22844c39e","observation_id":"987d6621-cb01-4a7e-8463-08ee09d332c3","resolution":{"observed_at":"2026-08-04T12:42:55.700567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10971","last_updated":"2024-07-15T17:59:52Z","snapshot_observed_at":"2026-08-07T03:58:50.200905Z","submitted_at":"2024-07-15T17:59:52Z","title":"Walking the Values in Bayesian Inverse Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10971","snapshot_observed_at":"2026-08-04T12:42:55.813564Z","title":"Walking the values in bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.813564Z"},"links":{"cited_paper":"/paper/2407.10971","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e921841e7359fc3fe4a83b805ebf3e63470b4b57f125ab295466591d34905f8f","observation_id":"e240067a-e277-4e0d-aea1-92a7cebae757","resolution":{"observed_at":"2026-08-04T12:42:55.813564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.940976Z","title":"A distributional perspective on reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.940976Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:43da809c38ebf99113aa4a22ae68d165e09f089b78be48d0697f459e05ce38cb","observation_id":"6d5069a7-bdef-4b9c-95eb-8e9c8b03b40a","resolution":{"observed_at":"2026-08-04T12:42:55.940976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.088085Z","title":"Variational inference: A review for statisticians","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.088085Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:7526add34ef7d6179db566769a6a7dcbb16f852971a837f3574bedb16e726a9a","observation_id":"a9ca4cd1-a0c0-4c5a-b060-f28417ab564d","resolution":{"observed_at":"2026-08-04T12:42:56.088085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06483","last_updated":"2021-03-11T22:51:45Z","snapshot_observed_at":"2026-08-06T18:59:56.250921Z","submitted_at":"2021-02-12T12:32:02Z","title":"Scalable Bayesian Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06483","snapshot_observed_at":"2026-08-04T12:42:56.164696Z","title":"Scalable bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.164696Z"},"links":{"cited_paper":"/paper/2102.06483","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:cad0f6fa23146b3c82dce15b553dd2a8718e6a67ac213de5dd323fce35319789","observation_id":"3280a2e8-d2b7-4a9e-b2b6-f5f3d768c23a","resolution":{"observed_at":"2026-08-04T12:42:56.164696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.276796Z","title":"Eliciting risk aversion with inverse reinforcement learning via interactive questioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.276796Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:d318a416e4553f77bd29da4cf94219663d13932b7074e2b17f63bd54bb40c9e6","observation_id":"87d522fa-a973-41ac-8739-c59118afa6d0","resolution":{"observed_at":"2026-08-04T12:42:56.276796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.402619Z","title":"Map inference for bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.402619Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:981c3763fe91144cc79f06875644ecc03e6776e845eb275f4916e7f08581b042","observation_id":"1251fc23-f23c-41da-b5ee-f62ade9979f4","resolution":{"observed_at":"2026-08-04T12:42:56.402619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.493316Z","title":"Implicit quantile networks for distributional reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.493316Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:96b2bf5baf375124dff0ed8cb09be66d4a4df952dc1a40dcb528d425a9eca3ca","observation_id":"8c67766b-f540-42ec-9332-be25c24175b9","resolution":{"observed_at":"2026-08-04T12:42:56.493316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.694782Z","title":"Distributional reinforcement learning with quantile regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.694782Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0963fd3c19dc1fd20a306e00f062691e303a6368ca49be51ebe76b2f9aa7d672","observation_id":"82372248-f577-43f2-94c3-bff25775f54a","resolution":{"observed_at":"2026-08-04T12:42:56.694782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.902589Z","title":"Cortical substrates for exploratory decisions in humans","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.902589Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:ebbab6298c346ca28d075128720162ec6821a1a2ed488fbf51da0c2c89bca28f","observation_id":"c0b8e8b4-6128-4a8e-b5c9-9fef05542847","resolution":{"observed_at":"2026-08-04T12:42:56.902589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.072176Z","title":"Nonuniform random variate generation","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.072176Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e4613708d18b9e4aef1ec0ea4828c9ab344590e96966820ea82be34927685d22","observation_id":"05695a72-5de5-4f56-8617-f3a7ef553418","resolution":{"observed_at":"2026-08-04T12:42:57.072176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.227314Z","title":"Remarks on quantiles and distortion risk measures","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.227314Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:3ad03632e02d55cf3a6efe25bce4dbbbef2917647da35970698e013f506dca74","observation_id":"6ca678e3-d3bd-4010-815b-0c40b3e63a09","resolution":{"observed_at":"2026-08-04T12:42:57.227314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.331776Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.331776Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:9c3a42b301e6d5510eedc5ae2df870d309956463910781fa8e35416b9374cee6","observation_id":"71049599-d292-4904-8b18-aca7577d1680","resolution":{"observed_at":"2026-08-04T12:42:57.331776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T12:42:57.503906Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.503906Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:63b4cf72106d4a731b3c73e5c21c7c1ef10724f5a3ed49cd5c435bdf12463b8b","observation_id":"6ff1f605-4b91-41a4-928e-48d7f8e0ade7","resolution":{"observed_at":"2026-08-04T12:42:57.503906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.530407Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.530407Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0355d3892a81027eb2616b0c05da22645daab2c10d2843dc53b2b436a5dca239","observation_id":"191ba8eb-0a53-45de-96b4-86c9b0c801af","resolution":{"observed_at":"2026-08-04T12:42:57.530407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.626102Z","title":"Probability: a graduate course, volume 200","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.626102Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6c2640fe29abc509060bb4873294cd7f74932b7675b94032bb17b893b08ea12d","observation_id":"d84e4251-f711-41d5-a78a-566f5746e555","resolution":{"observed_at":"2026-08-04T12:42:57.626102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.746691Z","title":"Rules for ordering uncertain prospects","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.746691Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6496fb62cbe86382ee1d69680970bde9490383d57b0f1b5e9c86471a9eb84e58","observation_id":"a9f5bb93-514b-4621-9b9d-60801c06df64","resolution":{"observed_at":"2026-08-04T12:42:57.746691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-04T12:42:57.841983Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.841983Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:7a78ef539d0b64eab8ddc8f2a53c286593411a4e1ddba4edf664ce21486e0f9d","observation_id":"c2569331-cc4c-4bc4-9fd4-e6d1bfa48911","resolution":{"observed_at":"2026-08-04T12:42:57.841983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.961326Z","title":"Introduction to real analysis, volume 280","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.961326Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:f79bdfb1bec89ce8f881407801d3c2f14c831645666324e5da95d7c60fbb1c6a","observation_id":"bcadbcff-cf03-4c10-884a-67ebf6fe7aca","resolution":{"observed_at":"2026-08-04T12:42:57.961326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.070477Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.070477Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4a8a1a341dff0250638340a69debe252333d3c500309eaed210841f16684a815","observation_id":"5adf489c-1b76-45a4-b6d5-39d8e54cfbca","resolution":{"observed_at":"2026-08-04T12:42:58.070477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.230803Z","title":"A bayesian approach to generative adversarial imitation learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.230803Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:bd49c360cf3cbadb67b90904b4c933516195dd8faefbe0b3b0ddbc19ed44b97a","observation_id":"5a7e6729-f9ef-450e-8d2c-57da76d2abf3","resolution":{"observed_at":"2026-08-04T12:42:58.230803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.278539Z","title":"Rize: Regularized imitation learning via distributional reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.278539Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:302da77ff4dbf3da4a43cce1e5b5938bb19900e74049ddb1156e26b551166c80","observation_id":"bb73d1d7-8978-4d1d-b438-4bb3022ba912","resolution":{"observed_at":"2026-08-04T12:42:58.278539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12633","last_updated":"2025-07-15T15:08:23Z","snapshot_observed_at":"2026-08-10T16:56:11.365132Z","submitted_at":"2025-01-22T04:38:33Z","title":"Inverse Reinforcement Learning with Switching Rewards and History Dependency for Characterizing Animal Behaviors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12633","snapshot_observed_at":"2026-08-04T12:42:58.307441Z","title":"Inverse reinforcement learning with switching rewards and history dependency for characterizing animal behaviors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.307441Z"},"links":{"cited_paper":"/paper/2501.12633","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:2363266aec11f8def46fa80c6b73ebdbb8f77e8266b2ec1f2b7328215ee46dff","observation_id":"c51944cb-860f-43b7-bdd3-aa00e00e696b","resolution":{"observed_at":"2026-08-04T12:42:58.307441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05032","last_updated":"2019-12-10T22:31:09Z","snapshot_observed_at":"2026-08-09T18:56:44.864560Z","submitted_at":"2019-12-10T22:31:09Z","title":"Imitation Learning via Off-Policy Distribution Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05032","snapshot_observed_at":"2026-08-04T12:42:58.311175Z","title":"Imitation learning via off-policy distribution matching","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.311175Z"},"links":{"cited_paper":"/paper/1912.05032","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b4d4624487fb6a8fd61a130c8ecb91f7840e7d8cbe5c9cda554013707230d896","observation_id":"0eb30226-101e-49d8-b78c-4e8d28c65da1","resolution":{"observed_at":"2026-08-04T12:42:58.311175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-04T12:42:58.314862Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.314862Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a37a6eb4fca69293d06c33bf448f80f1e4a8cdfa09d4731c5bebcb088f68cb79","observation_id":"4a2b943b-36dd-43c2-8c59-3d1ea16fc9af","resolution":{"observed_at":"2026-08-04T12:42:58.314862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.318874Z","title":"Risk-sensitive generative adversarial imitation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.318874Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:3747e2a075c5fa5068045858eab9b1aadb1720cba6fe5b7583cf585afd222426","observation_id":"96537912-f523-42aa-9d93-d40580eef4d7","resolution":{"observed_at":"2026-08-04T12:42:58.318874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.322564Z","title":"A tutorial on energy-based learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.322564Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:dee6c225a8acd9f3690de5d1bd3a59b6bce44fb54a936bed938a31ca64d3461d","observation_id":"522bfb5c-f96f-4eea-875c-cdeae8180990","resolution":{"observed_at":"2026-08-04T12:42:58.322564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.325721Z","title":"Risk-sensitive mpcs with deep distributional inverse rl for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.325721Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:602b9cc565361a684457f4883941a277718f50e918680c109affefeef3165bfa","observation_id":"6274dfce-ac41-4ba8-970c-be7613c3b777","resolution":{"observed_at":"2026-08-04T12:42:58.325721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.330053Z","title":"Nonlinear inverse reinforcement learning with gaussian processes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.330053Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4018bd7bb138648cfbe65aea47e54fc66e5ca7d5d742cc7127eb4054fc016d2c","observation_id":"38eaa1e7-0b35-4894-b588-06dcbbc25883","resolution":{"observed_at":"2026-08-04T12:42:58.330053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.333477Z","title":"Internally rewarded reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.333477Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e7eb45b1b8464dc5489f08c11489b5d846ffbdb377b9929d1e6fd5e89be0bdd0","observation_id":"a6701269-4e89-4611-9d51-e494dc725a07","resolution":{"observed_at":"2026-08-04T12:42:58.333477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01796","last_updated":"2024-10-02T17:53:23Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T17:53:23Z","title":"Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01796","snapshot_observed_at":"2026-08-04T12:42:58.337145Z","title":"Bellman diffusion: Generative modeling as learning a linear operator in the distribution space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.337145Z"},"links":{"cited_paper":"/paper/2410.01796","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a4d5e5de69c1c72d1cd0ab0d7f41e16c132dd76c6894057beb02c8c4d8839ba9","observation_id":"789e4226-b552-4357-ae0f-9ff5342a97de","resolution":{"observed_at":"2026-08-04T12:42:58.337145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.341059Z","title":"Distributional reinforcement learning for risk-sensitive policies","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.341059Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:76ec267c72cecac306a46768d0c537a46f134d7970ad8963db7f21d7fc900e7a","observation_id":"83032962-50b1-42ca-af09-87ba7654cf0c","resolution":{"observed_at":"2026-08-04T12:42:58.341059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06827","last_updated":"2025-07-03T04:27:15Z","snapshot_observed_at":"2026-08-05T07:12:48.478594Z","submitted_at":"2023-03-13T03:00:03Z","title":"Kernel Density Bayesian Inverse Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06827","snapshot_observed_at":"2026-08-04T12:42:58.344896Z","title":"Kernel density bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.344896Z"},"links":{"cited_paper":"/paper/2303.06827","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:ea18ed53cbf7460f38673986c932636ba4a019c849cd6e5c3e811c9bf029c85b","observation_id":"b1e489fe-d107-4c75-b4da-8e70b1bf39c2","resolution":{"observed_at":"2026-08-04T12:42:58.344896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.348525Z","title":"Spontaneous behaviour is structured by reinforcement without explicit reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.348525Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4cc2780deb6d44beff27c33fc22f9214ede2272a47af4e2b417d136019fa73b9","observation_id":"9cd77b32-3602-4bbc-8a2a-6df66c756a64","resolution":{"observed_at":"2026-08-04T12:42:58.348525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.351966Z","title":"Spontaneous behaviour is structured by reinforcement without explicit reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.351966Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e76542037614066a1eebc09fa7ce88d16fc280395597ec7f029426b169a2b1c5","observation_id":"fc515a0d-1ff0-4141-97ee-87b63a27c736","resolution":{"observed_at":"2026-08-04T12:42:58.351966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.355441Z","title":"The kolmogorov-smirnov test for goodness of fit","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.355441Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:df380fa82bf26c9cfdb005e26e769407000d0abe1ca6c43e0340ba786a378e35","observation_id":"b780f1f3-fe50-484b-9146-888e506328f0","resolution":{"observed_at":"2026-08-04T12:42:58.355441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.358680Z","title":"Foraging for foundations in decision neuroscience: insights from ethology","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.358680Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:75a6c04095cbc6daf9b33d7c580723e76b90c7855e28109d901128b5b8fd710c","observation_id":"89935910-fef2-4b54-9ee2-bb176b05306b","resolution":{"observed_at":"2026-08-04T12:42:58.358680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.361919Z","title":"f-irl: Inverse reinforcement learning via state marginal matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.361919Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a8587b17bba8ff553dca9376ded1a12ef1efa950039de31edf60a4a072f059f2","observation_id":"fd7e5dd7-16e3-44a6-8a66-6f40131ed568","resolution":{"observed_at":"2026-08-04T12:42:58.361919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.365160Z","title":"Bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.365160Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:1d783557a8011c864574c4f423c10c22db9fc342f8f9a9f5a5bb9a6b5efa99bd","observation_id":"49e421da-f209-41ef-a317-006242c67d6c","resolution":{"observed_at":"2026-08-04T12:42:58.365160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.368395Z","title":"Optimization of conditional value-at-risk","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.368395Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:53005bf6adc472acf8f7f67f06fe03edd4d20c9d4f125a0866d3746048f04842","observation_id":"d10c9de8-520a-44ea-81d5-ef6ce727d9f7","resolution":{"observed_at":"2026-08-04T12:42:58.368395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.372070Z","title":"Driving with style: Inverse reinforcement learning in general-purpose planning for automated driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.372070Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:fa0b3d5e45401336937e55761d482d4c1c2eb1b4ffe5136bd1608664d85a9bdd","observation_id":"962fc82b-049f-43bb-a3db-974dcc98e7af","resolution":{"observed_at":"2026-08-04T12:42:58.372070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.375329Z","title":"Learning risk-aware quadrupedal locomotion using distributional reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.375329Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:011b8b8d9b51a4341bb99869a77d255bf7870033b5672c8af558d31b89975850","observation_id":"bd848cbc-33f6-462e-bffb-0fe808aa7fd6","resolution":{"observed_at":"2026-08-04T12:42:58.375329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.378371Z","title":"A neural substrate of prediction and reward","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.378371Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:cf1641cb55ed8283481d7f4c555130df9c4b42f8e5b174b4d7c2093d6342d977","observation_id":"d70fa356-7c2a-4479-9e7b-87088047875d","resolution":{"observed_at":"2026-08-04T12:42:58.378371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.381868Z","title":"Distortion risk measures in portfolio optimization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.381868Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0914c60c13ac4078e572e36d265a2239c725d98551784fdbac07bda7a802682e","observation_id":"e934e22a-4172-48e9-ad35-ff0ea398474a","resolution":{"observed_at":"2026-08-04T12:42:58.381868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.385441Z","title":"Risk-sensitive inverse reinforcement learning via semi-and non-parametric methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.385441Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:8422b436a4c2294229f113a5052e6308d6df3f86a59cb0e987fdb11149fb1c03","observation_id":"f8643bf4-bbad-422a-8b03-dda969f203f9","resolution":{"observed_at":"2026-08-04T12:42:58.385441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.389074Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.389074Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b2a71a95c33f5ba5398e6775db39b83d9fa80fbd1d4c7398ca760b88793a0ab2","observation_id":"694dc24c-9400-4ba9-baa9-422b04a29993","resolution":{"observed_at":"2026-08-04T12:42:58.389074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05371","last_updated":"2021-02-10T10:27:49Z","snapshot_observed_at":"2026-08-06T21:10:42.763482Z","submitted_at":"2021-02-10T10:27:49Z","title":"Risk-Averse Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05371","snapshot_observed_at":"2026-08-04T12:42:58.392711Z","title":"Risk-averse offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.392711Z"},"links":{"cited_paper":"/paper/2102.05371","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4166c961119ae4f93d025537efaf9477d8f2c7970e8195a630c00662605b379b","observation_id":"ae7feb3d-cf74-45cc-9a8f-b91b17477862","resolution":{"observed_at":"2026-08-04T12:42:58.392711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.396647Z","title":"Inverse reinforcement learning algorithms and features for robot navigation in crowds: an experimental comparison","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.396647Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0198f3f93ec136d07c2722e16c552856491d6bd4a7531db649a29387b6ea3905","observation_id":"f284b05b-1aed-4ac9-a934-981632a98f3f","resolution":{"observed_at":"2026-08-04T12:42:58.396647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.399778Z","title":"A bayesian approach to robust inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.399778Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b0409c797674ecf505d2365057757afabb015041e849ad266408957921620ea1","observation_id":"619a0652-a124-43d8-ac85-72d12e9b5eed","resolution":{"observed_at":"2026-08-04T12:42:58.399778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.402913Z","title":"Foundations of multivariate distributional reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.402913Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4e4ea68c6e00a22b6e69ddb2a8c8f8e13f12eeb643a68e5149797e7bbc3fdc35","observation_id":"b54de15a-532a-4048-895d-f47826a0041c","resolution":{"observed_at":"2026-08-04T12:42:58.402913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.406388Z","title":"Inverse reinforcement learning with the average reward criterion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.406388Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:69c10ba4965bdb430f99229706b42e666650480f740709d5e2df54c941a56018","observation_id":"ac59373e-e0cd-40cf-a6f2-1b0b3e05b5d1","resolution":{"observed_at":"2026-08-04T12:42:58.406388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.410677Z","title":"Infer and adapt: Bipedal locomotion reward learning from demonstrations via inverse reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.410677Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:645d5e1e7bbb7d4c52e10fd21f695d9dbb345b99fbbfd2428ffeb65d36f38891","observation_id":"928c7e42-6f67-4705-b4b8-226eb39208a6","resolution":{"observed_at":"2026-08-04T12:42:58.410677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.414728Z","title":"Efficient sampling-based maximum entropy inverse reinforcement learning with application to autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.414728Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e075361347002db80bdc654d01c66320669c767b508eba5be404f128aa3c0cc3","observation_id":"21d38730-2082-4924-9641-d4821001d9b2","resolution":{"observed_at":"2026-08-04T12:42:58.414728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04888","last_updated":"2016-03-11T11:02:00Z","snapshot_observed_at":"2026-07-06T04:24:07.477067Z","submitted_at":"2015-07-17T09:30:03Z","title":"Maximum Entropy Deep Inverse Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04888","snapshot_observed_at":"2026-08-04T12:42:58.418262Z","title":"Maximum entropy deep inverse reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.418262Z"},"links":{"cited_paper":"/paper/1507.04888","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:dbb82b50238e9bdcf0b583ba1253162006789a8b7d71995dc1258077ebce6643","observation_id":"be72741b-a6bd-4959-b66a-c2d68dd9bf25","resolution":{"observed_at":"2026-08-04T12:42:58.418262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.421838Z","title":"Modeling, learning, perception, and control methods for deformable object manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.421838Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:d29e3490d7a5c3bef2704672f5b21ba33de8204482b39fa752f676aefdc26eaa","observation_id":"4b45876f-d777-4d36-a0ab-a76728734313","resolution":{"observed_at":"2026-08-04T12:42:58.421838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.425216Z","title":"Maximum-likelihood inverse reinforcement learning with finite-time guarantees","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.425216Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:49a6c0a580fe41715c5fc772b389ebd6a934ac8ef55aa017398287f259d77bce","observation_id":"c6610b64-fb91-4bf9-b361-f978d26a6849","resolution":{"observed_at":"2026-08-04T12:42:58.425216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.428599Z","title":"When demonstrations meet generative world models: A maximum likelihood framework for offline inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.428599Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0914be60bc1c09799882c8f417479a668021382d0a2276d6e77f2f950735798c","observation_id":"370e9883-f575-4580-9d4d-3c98b22aa114","resolution":{"observed_at":"2026-08-04T12:42:58.428599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13538","last_updated":"2025-03-15T20:53:46Z","snapshot_observed_at":"2026-08-07T17:01:30.481150Z","submitted_at":"2025-03-15T20:53:46Z","title":"From Demonstrations to Rewards: Alignment Without Explicit Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13538","snapshot_observed_at":"2026-08-04T12:42:58.431814Z","title":"From demonstrations to rewards: Alignment without explicit human preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.431814Z"},"links":{"cited_paper":"/paper/2503.13538","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:d328f879650c577773cf6eb7b689df58bca9b366aa7fc7862f39e42e7b4e5fd0","observation_id":"d71cef4b-e355-4f82-8641-1f296cff776e","resolution":{"observed_at":"2026-08-04T12:42:58.431814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.435351Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.435351Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:03081b0a900a828d1acf058f473db217b6d255024af9526ed0af5f6d758108c1","observation_id":"41948553-1110-4682-9151-3bb609fa59b0","resolution":{"observed_at":"2026-08-04T12:42:58.435351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.438443Z","title":"Modeling interaction via the principle of maximum causal entropy","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.438443Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e1360666098465e74a7059947dc6ba258839dc523f6a8cdaea6c025aec104265","observation_id":"b22c4cda-33a9-4827-a484-d24b276a9057","resolution":{"observed_at":"2026-08-04T12:42:58.438443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.441299Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.441299Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:fc58ec4d9b4b86118d1f64adabcc0f1efe6e34b11ddb432e67870ca5e6738aa9","observation_id":"ee23053d-dee5-4620-84c1-22874c44a4ba","resolution":{"observed_at":"2026-08-04T12:42:58.441299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.445479Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.445479Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:24a8dd267a494b4e9caa39d2562248704eb1a8990803ae067071176acab326a3","observation_id":"d7ffbf34-29ce-49cd-8d9f-9c684f698892","resolution":{"observed_at":"2026-08-04T12:42:58.445479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.448782Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.448782Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:79b2fdded98c5fd228c2f7986ea382f7b53ad9ef3db9c5dd07fa3b7822da44f1","observation_id":"ac7d397b-a0ae-4487-a0cf-968152f5c08f","resolution":{"observed_at":"2026-08-04T12:42:58.448782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T10:26:21.494267Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2510.03013."}