{"as_of":"2026-08-18T20:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89a342db539079ec4d0a7bb6209cd4538deae66cee5514c90041633fc4aa090a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:39:09.023785Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.14379/citation-record","integrity":"/paper/2508.14379/integrity","json":"/paper/2508.14379/citation-record.json","paper":"/paper/2508.14379"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.529120Z","title":"Resource constrained deep reinforcement learning","venue":null,"work_id":"6af04599-afb3-4304-8dee-afc3c2304c2a","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.673880Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:418e4dc7a8fa95695ffca45f0fdb5b0fc93d16edaed77fd56fc875b559e3c890","observation_id":"0317c36a-d7c9-43b2-b94d-94b8714e4e3e","resolution":{"observed_at":"2026-08-05T18:39:17.665496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.306640Z","title":"S., and Mikelsons, L","venue":null,"work_id":"0ca6d344-d674-493e-9b8a-a492f30ccc2f","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.803846Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:2db1d97a341d0acdb65984798036bc63b21afb44fe049c6eb5d336fa0233d4b3","observation_id":"021687b6-9174-44ae-b075-d172bd4415e9","resolution":{"observed_at":"2026-08-05T18:39:17.434744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.072654Z","title":"FlowPG: Action-constrained Policy Gradient with Normalizing Flows","venue":null,"work_id":"52559a67-9c03-4d4b-8f81-0c9f25c31e03","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.927918Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:e5b68eb5fdfce68e50337b42ba0673ba452f31d9fb26d2654ec6851a0df0351d","observation_id":"f7b91e95-adea-4d93-8851-438935799594","resolution":{"observed_at":"2026-08-05T18:39:17.186283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-05T18:39:04.090109Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.090109Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:300d76939add6b08a97077edfc59ce591fe5bc4fa3636f2208e6e90c3d5c11ed","observation_id":"bae50a55-305f-4056-8327-fcd105402ec3","resolution":{"observed_at":"2026-08-05T18:39:04.090109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.800390Z","title":"Generative modelling of stochastic actions with arbitrary constraints in reinforcement learning","venue":null,"work_id":"2318efbf-c4e2-45ea-9270-ccddfa59aafa","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.218997Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:adce0feb1dfc61931322234d5262dc6dfb151545d9c3bf1ce560989b1b20a8b0","observation_id":"81e6faea-4777-447c-82d7-a90c4344734b","resolution":{"observed_at":"2026-08-05T18:39:16.951951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.651017Z","title":"A Lyapunov-based approach to safe reinforcement learning","venue":null,"work_id":"599a4868-0c92-417f-9c5a-c909371d35d2","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.349240Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:0b4cf331e8555c51f04beff38289eb7b63aa4da96b661350e8046bb53e362823","observation_id":"486d06bb-80a6-4d10-abc4-2936d2427bdb","resolution":{"observed_at":"2026-08-05T18:39:16.711057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.397419Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"891d854f-fa77-415d-a1f0-eb066f984d6e","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.517907Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:61288749c0dc9edc6759382550bd200439782111bedfb487111913b8f79d831d","observation_id":"1dafe341-64a2-4ff1-8a3f-d9516223d438","resolution":{"observed_at":"2026-08-05T18:39:16.522444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-15T12:58:42.845462Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-05T18:39:04.666273Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.666273Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:b5b17ad26caa7d301e8021de775bb5566175ac09c598412cfb0508e99e94d89d","observation_id":"d0821ab8-e913-49c9-b04c-25e773aa93f8","resolution":{"observed_at":"2026-08-05T18:39:04.666273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.112685Z","title":"J., Sarafian, E., and Kraus, S","venue":null,"work_id":"aa55237f-4158-4f97-9d59-55268c1308fd","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.841831Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:8ed0c407a3f53ae6ef17ff4dff3f84d0db24492d4abf26713bea57766526bdef","observation_id":"174c807c-5b92-4e60-aee7-7f5fb2a8ef19","resolution":{"observed_at":"2026-08-05T18:39:16.230758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T18:39:04.995300Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.995300Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:d2b8bab5ecb44e4f4bb2842f5264e0a1be5c033ae7ceaf794a5bc7a774f96b7e","observation_id":"2d4a01d8-5431-4ff3-b9cc-a90db187aa92","resolution":{"observed_at":"2026-08-05T18:39:04.995300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11879","last_updated":"2020-02-27T02:27:46Z","snapshot_observed_at":"2026-08-12T23:18:00.134760Z","submitted_at":"2020-02-27T02:27:46Z","title":"State-only Imitation with Transition Dynamics Mismatch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11879","snapshot_observed_at":"2026-08-05T18:39:05.127078Z","title":"and Peng, J","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.127078Z"},"links":{"cited_paper":"/paper/2002.11879","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:a503e11391023d1be20dae2b329a3f2e4def1e65af4f5b26fcc0f07d00b068c9","observation_id":"4e85acfa-2693-4366-a83e-3f4f38f8d996","resolution":{"observed_at":"2026-08-05T18:39:05.127078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.823212Z","title":"Y., and Jin, H","venue":null,"work_id":"ed5fb9e9-cb62-4f29-9327-c236a2903d5b","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.266003Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:fe30213d21dd96524e14c9f507f34fef3d11f18963646fc72f7d86dc017a5f8e","observation_id":"5337134a-ebdf-49f1-9504-f98eb0889c21","resolution":{"observed_at":"2026-08-05T18:39:15.965270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.541171Z","title":"Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates","venue":null,"work_id":"dc710730-7b8e-492a-833a-904fa3876edf","year":2017},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.386486Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:51b30338b08f031215b95258320d279cc53611319b5c2fd8457c7f329353985d","observation_id":"63707c4e-d09f-41b8-8985-cdaea451907d","resolution":{"observed_at":"2026-08-05T18:39:15.698183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.311676Z","title":"A., Su, H., and Wang, X","venue":null,"work_id":"62a272ae-dcbf-46bd-9e2d-b3cc13567cec","year":2022},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.479619Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:746287246a866a983278664512bccc51478afa48b5bdde694e150a90df0eae00","observation_id":"f4f33605-7dd1-4314-a952-78e97370ba6a","resolution":{"observed_at":"2026-08-05T18:39:15.418317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.020867Z","title":"and Chiba, S","venue":null,"work_id":"bf75cd26-782e-44fa-b28d-4fee1fdd5abe","year":1978},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.591019Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:ae958fda256546789252e68124a836edd41da44e7b5928325e213228256f8d5a","observation_id":"32b46bf8-052b-42b5-b357-a4ed7c331c1b","resolution":{"observed_at":"2026-08-05T18:39:15.166272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:05.700032Z","title":"and Ermon, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.700032Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:7d6266f49e56db74a531afff453027d70f492195e083d469b6ad3b94d83d14ba","observation_id":"f3f841a4-b0a1-4d76-97ef-982c8d6671d6","resolution":{"observed_at":"2026-08-05T18:39:05.700032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.703037Z","title":"Diffusion imitation from observation","venue":null,"work_id":"d300d1bd-9904-4617-bc9d-2e025ac4ac66","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.824177Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:f984dca58a56fa9b58d662f9ea2fee80f187298969897c926e6f125e5f6957f1","observation_id":"17b3d8b4-9813-4f5c-8b50-471ce78db6f8","resolution":{"observed_at":"2026-08-05T18:39:14.832696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.487954Z","title":"Efficient action-constrained reinforcement learning via acceptance-rejection method and augmented mdps","venue":null,"work_id":"56da61a8-6c88-481e-adfa-8b3e60a20e1c","year":2025},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.915748Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:28c74affaebab973bba0399cd228a6b01dd306a1c89f003eb8cbdd6e312288c1","observation_id":"152860e1-b7a2-46f4-96a2-eda3a3b040c0","resolution":{"observed_at":"2026-08-05T18:39:14.587491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.260792Z","title":"and Porta, J","venue":null,"work_id":"80bbe74e-78e1-41c2-b0fe-ca79430697c4","year":2012},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.111806Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:8aa999f55931dd5ce50c2585dc6b0c886cbe2ed567df53f461bc59b214c13e66","observation_id":"52e8a8ce-d846-4950-9c24-019ab6e57438","resolution":{"observed_at":"2026-08-05T18:39:14.377500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.043888Z","title":"Benchmarking actor-critic deep reinforcement learning algorithms for robotics control with action constraints","venue":null,"work_id":"b4875e59-b2f8-4d0c-86a0-73f1d3bac630","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.209388Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:47820ed88200d7cf07b654530e26e4eb7b8611bed0323abb3b9f2be94bcd6c30","observation_id":"07cf5c1d-9ee7-4abd-b2a9-07cfff8595a7","resolution":{"observed_at":"2026-08-05T18:39:14.141422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.784071Z","title":"K., Dwibedi, D., Levine, S., and Tompson, J","venue":null,"work_id":"07a6025a-5419-4565-8667-7deb15d10543","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.341673Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:4e6da5b5e3e265fd5c71851070c946da7777a957c73827905b84d08b3d6b9ad7","observation_id":"7ea0d664-13ab-4066-affc-4b780baf4a92","resolution":{"observed_at":"2026-08-05T18:39:13.883022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.564941Z","title":"Imitation learning via off-policy distribution matching","venue":null,"work_id":"abd78d09-e185-4078-bba6-71e0549689d4","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.475122Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:489fed6e0b07300dadc16069497dc3a0ba87ec0139379a85982d7c7ab1ce7b43","observation_id":"dc136b3b-279e-4e96-b59a-0e2096ca5e9b","resolution":{"observed_at":"2026-08-05T18:39:13.662802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.353307Z","title":"F., Chen, M.-H., and Sun, S.-H","venue":null,"work_id":"8b5319c2-7d07-4cea-831c-19efe945bbbb","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.659062Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:3c24b79202609f6c9f6208bd0f479a49aa04a079c0ce8fc33fc967ac61ab25cc","observation_id":"fb0393b1-99a4-4e5f-bfbd-f67748ddf88e","resolution":{"observed_at":"2026-08-05T18:39:13.457443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.160676Z","title":null,"venue":null,"work_id":"7ee26b5f-a15a-4d35-8c60-351762a23384","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.796172Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:384ba8c8a24e731ee2f63a9c3f98dc62e04bd8c8c7a6cc4e9e9eb205c1f77e9e","observation_id":"5649621b-54f5-4aaf-8ee9-8bd41f7cce44","resolution":{"observed_at":"2026-08-05T18:39:13.257485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.865673Z","title":"Escaping from zero gradient: Revisiting action-constrained reinforcement learning via Frank-Wolfe policy optimization","venue":null,"work_id":"089bcbb7-f4d4-44b1-8d12-6b519ba3127f","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.879650Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:56ec386fab9938778e0fa10c5b376c475c591f7c2a5cc1b54c2a1373a90204ec","observation_id":"2d0a72cc-0cf0-40ab-9b27-bc18696b3352","resolution":{"observed_at":"2026-08-05T18:39:13.006924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.588268Z","title":"Robust regression for safe exploration in control","venue":null,"work_id":"427678f9-f546-474b-a712-1c95c5b6cdbf","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.018574Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:d02ae6f983167faf405a82f1dfb3a559e62ad7cd17a98b1cc663e81f5d25cfc6","observation_id":"608300ba-b6d8-464e-82f0-edca54dcc8e2","resolution":{"observed_at":"2026-08-05T18:39:12.724584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10947","last_updated":"2019-11-21T22:18:16Z","snapshot_observed_at":"2026-08-05T18:20:08.979986Z","submitted_at":"2019-11-21T22:18:16Z","title":"State Alignment-based Imitation Learning","version":1},"cited_work":{"arxiv_id":"1911.10947","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.10947","snapshot_observed_at":"2026-08-05T18:39:09.187690Z","title":"State Alignment-based Imitation Learning","venue":"cs.LG","work_id":"bae957e4-8f52-4fbd-b3a9-0d5342269747","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.147640Z"},"links":{"cited_paper":"/paper/1911.10947","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:77582321df5e3ae44adba697b551259adb026d228f497ae2e8e5fbf878789c46","observation_id":"2bdd11d8-bcb1-4522-847a-0c1dbaff3641","resolution":{"observed_at":"2026-08-05T18:39:09.274870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.364629Z","title":"Optlayer - Practical constrained optimization for deep reinforcement learning in the real world","venue":null,"work_id":"774e0556-fec3-4459-98ee-d7eb7f8f5f47","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.290347Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:1a9618f41b810e1456922aca208aca5766ffeed7b74e0744d48675d51b164b7a","observation_id":"459cc8cf-405f-4a60-848e-b02a9f2f3942","resolution":{"observed_at":"2026-08-05T18:39:12.467249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.110777Z","title":"Efficient training of artificial neural networks for autonomous navigation","venue":null,"work_id":"b1fa759c-ef68-4a72-8721-3e1bd4ac6022","year":1991},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.428533Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:31bc30819ffec01296c4be91ec0dded8d416b77b39995a69b616b2d83118e5f3","observation_id":"31ae075f-f2e3-4d08-a617-e303208b3ba4","resolution":{"observed_at":"2026-08-05T18:39:12.217407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.857248Z","title":"State-only imitation learning for dexterous manipulation","venue":null,"work_id":"d6a31ff5-4972-4b15-bb3b-c803fdf172f5","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.572399Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:75294e3288bd714cef7a64f4244d547959924b82058d137acbd1a6b1c51871fc","observation_id":"fc15dbf5-a817-4c6e-b5c2-81bfd8eba370","resolution":{"observed_at":"2026-08-05T18:39:12.003077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.591759Z","title":"Learning off-policy with online planning","venue":null,"work_id":"acd9a60d-e23b-44a7-8945-39eb01d89192","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.684694Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:bfac18ddbf85b68568a43f720dc77ffdc5220ef97719eab350b09a0e24970ee4","observation_id":"caf0ac84-5caa-416d-88b9-55e36d161b99","resolution":{"observed_at":"2026-08-05T18:39:11.698822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.352554Z","title":"Behavioral cloning from observation","venue":null,"work_id":"5724113c-ca04-49ee-b755-9d4dabf82f7e","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.823604Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:896a2a676c8149753989bd51c6d8d43a8c4c6e40a2b39f9c9de90cf70a7e5744","observation_id":"aa4b30b5-c50f-42d5-9d09-bd66a105907c","resolution":{"observed_at":"2026-08-05T18:39:11.448680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06158","last_updated":"2019-06-18T04:56:56Z","snapshot_observed_at":"2026-08-18T08:58:09.128606Z","submitted_at":"2018-07-17T00:25:15Z","title":"Generative Adversarial Imitation from Observation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06158","snapshot_observed_at":"2026-08-05T18:39:07.938855Z","title":"Generative adversarial imitation from observation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.938855Z"},"links":{"cited_paper":"/paper/1807.06158","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:954bf19d969bbec2151b9b0082deacc7bdc11d16f6b079122a65a4cb77023363","observation_id":"a47976e1-bbd8-404a-86cd-36052b4f2d0f","resolution":{"observed_at":"2026-08-05T18:39:07.938855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.089085Z","title":"Deepgait: Planning and control of quadrupedal gaits using deep reinforcement learning","venue":null,"work_id":"d13cb6dd-3920-4632-b0f3-064de742dc98","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.091851Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:ab98844875d73e2bcfbf250b52f16e5f5b17cf703acccdebfea5b0fde1a1c6aa","observation_id":"2fcdad65-57cd-4439-93e2-209067f3c8d2","resolution":{"observed_at":"2026-08-05T18:39:11.191544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.848928Z","title":"H., and Yang, D","venue":null,"work_id":"cd7b8866-67bc-4660-8ed9-d13cd79ecae4","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.221990Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:7c7faf09781ac2744cad623dcd8be0a1d2a351b7f38c87d301a5962650182e98","observation_id":"ee8d79f5-4472-401f-8bcd-5a3368c52e00","resolution":{"observed_at":"2026-08-05T18:39:10.988317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.595623Z","title":"Imitation learning from observations by minimizing inverse dynamics disagreement","venue":null,"work_id":"9c6246dd-420f-4ec5-af5e-213053bf5d47","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.366342Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:db80d7affa36688e5efa2c47890c2b997bd4b14bcb7b44c9ec1879620a5ad864","observation_id":"3c9b06ba-911e-4eaa-89d9-12713e47e0de","resolution":{"observed_at":"2026-08-05T18:39:10.728135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.306895Z","title":"M., Khosravi, A., and Nahavandi, S","venue":null,"work_id":"9a893843-cd7e-4210-a355-d9919b376e9f","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.477323Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:08e15d1da7b7ae5b9c874bffc031afd826b10cdbf5892f730acde8260b1667a8","observation_id":"d35f65fc-f012-4a2b-a356-d82ca43a119f","resolution":{"observed_at":"2026-08-05T18:39:10.455236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.046401Z","title":null,"venue":null,"work_id":"e4c65f85-7afb-4b11-8181-175461d2bce3","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.595407Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:310e4251bcb216b08b97df254df13091d4966d85db2fab2ca8a708e0a6ee6e82","observation_id":"f84aecf6-cde2-4ad9-b675-18f1430f5ce9","resolution":{"observed_at":"2026-08-05T18:39:10.133887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.771893Z","title":"robosuite: A modular simulation framework and benchmark for robot learning, 2025","venue":null,"work_id":"8e8bd257-bf2b-48a7-b93b-94270d4f49ff","year":2025},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.725734Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:575385366fc623ceb7129f71f221def95eb39cbf652200640fcf0bd6ab80c13c","observation_id":"b85df8ac-0885-4e0e-84f2-98d23a6ce467","resolution":{"observed_at":"2026-08-05T18:39:09.886605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.526453Z","title":"Off-policy imitation learning from observations","venue":null,"work_id":"33d5e567-2c22-4a63-abe3-89c1bf8f9857","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.866328Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:f730cc9bb295f4caa79f8caf4a8d2fea071a9cc4e40c766b9d1f04a8ef500107","observation_id":"da5ef1f5-d016-4e65-9554-42a9668a5f57","resolution":{"observed_at":"2026-08-05T18:39:09.614024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.023785Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:09.023785Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:12cb28c97c649af37b55eda68cd10278e38e1c59cd32bd7e2d8136e45d624c19","observation_id":"5d651e2c-22b0-4c47-bf81-50fef9e5ed2f","resolution":{"observed_at":"2026-08-05T18:39:09.023785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T15:29:53.827663Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2508.14379."}