{"as_of":"2026-08-18T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae561285c3e16e070ddf5ff71e04d5bc96a976a4ad9f2c88db0c2d63db208cc3","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:17:00.752013Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:11:19.817366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:06:32.580014Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15529","snapshot_observed_at":"2026-08-15T20:11:19.817366Z","title":"Yuzhe Ma, Xuezhou Zhang, Wen Sun, and Jerry Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12815","last_updated":"2026-05-28T09:15:36Z","snapshot_observed_at":"2026-08-17T20:43:31.973241Z","submitted_at":"2025-06-15T11:27:49Z","title":"TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:19.817366Z"},"links":{"cited_paper":"/paper/2501.15529","citing_paper":"/paper/2506.12815"},"observation_digest":"sha256:584479b2731f3eae1f24712483e55986e296ec103a06c759817a034433f252e1","observation_id":"51502c44-f34f-491e-966b-1bf63edebc47","resolution":{"observed_at":"2026-08-15T20:11:19.817366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.15529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49b1b05b-c523-454f-844d-3960cc414e45","year":2025},"citing_paper":{"arxiv_id":"2605.01950","last_updated":"2026-05-03T16:19:45Z","snapshot_observed_at":"2026-08-12T23:48:01.748170Z","submitted_at":"2026-05-03T16:19:45Z","title":"TRAP: Tail-aware Ranking Attack for World-Model Planning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:45.407680Z"},"links":{"cited_paper":"/paper/2501.15529","citing_paper":"/paper/2605.01950"},"observation_digest":"sha256:b576d3c81780d8da8485fb1ba1e36126f459872541d8df3bfd3f3d0d2bf6a8a4","observation_id":"14ec6832-d376-4e9f-9592-7998576a12fd","resolution":{"observed_at":"2026-05-11T10:56:04.986739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.15529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49b1b05b-c523-454f-844d-3960cc414e45","year":2025},"citing_paper":{"arxiv_id":"2605.08612","last_updated":"2026-05-09T02:15:10Z","snapshot_observed_at":"2026-08-16T14:31:35.340125Z","submitted_at":"2026-05-09T02:15:10Z","title":"ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T01:16:35.508455Z"},"links":{"cited_paper":"/paper/2501.15529","citing_paper":"/paper/2605.08612"},"observation_digest":"sha256:1b1400c29f1dfc0e670de01ab10f090460eb5bc598e79b8024d8334267ebdb67","observation_id":"0151ae62-cf6b-4b52-ac88-cdcd22d3132c","resolution":{"observed_at":"2026-05-12T08:06:32.583799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15529/citation-record","integrity":"/paper/2501.15529/integrity","json":"/paper/2501.15529/citation-record.json","paper":"/paper/2501.15529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.495781Z","title":"Gpt-4 Technical Report","venue":null,"work_id":"0b46493a-5953-4ed8-9129-a72a25eef919","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.525017Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:d3b616153dc7127e8ea5578643f0ca7fb13df370a0e60a4a58f8f9f5b9796765","observation_id":"c0905ce4-11e9-4b37-9141-4fdddd5c6ab8","resolution":{"observed_at":"2026-08-10T14:17:01.499212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.485256Z","title":"Poisoning Deep Re- inforcement Learning Agents with In-Distribution Trig- gers","venue":null,"work_id":"86c58dec-c66a-4fe3-a239-57f304003b64","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.529517Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:7f223cec70768d8eaf04444cb41b335aa9521ef4ab9b44ba433742e7c2faf1f1","observation_id":"8b59b84c-0f28-4ae8-af31-c44467e5f9c9","resolution":{"observed_at":"2026-08-10T14:17:01.488831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.474573Z","title":"Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data","venue":null,"work_id":"57d2cb54-f731-4c10-8bb6-c7db07861f7b","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.533411Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:5f411ab35d5eaf7f2753dfea6a9624ab8533c04ead31ccbc101ed99f11d1b240","observation_id":"5aa463cb-f930-469c-b8e2-2b6b36176207","resolution":{"observed_at":"2026-08-10T14:17:01.478148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.464284Z","title":"Vulnerability of Deep Reinforcement Learning to Policy Induction At- tacks","venue":null,"work_id":"7523c81a-139f-49d0-a769-dabc2c3a1be2","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.537348Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:a148b6835071d970d38ab42d798e376ce3ef66ba845ffe5214cd14ca3eeee3a1","observation_id":"1b1a9434-8c2f-4fc5-9f3c-e4b66c6846e9","resolution":{"observed_at":"2026-08-10T14:17:01.467876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.453820Z","title":"Machine Un- learning","venue":null,"work_id":"776e3743-7e7b-49f9-8f69-e849414dca15","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.541442Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:c3865f3927ab86f7ad34a14314c2f7b54aed8beaca1d77c565d8cf1ef9aaa1f6","observation_id":"0cdc5baa-6fa5-4a5d-b50c-9f5a519cc3c7","resolution":{"observed_at":"2026-08-10T14:17:01.457728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.443488Z","title":"Poisoning and Backdooring Contrastive Learning","venue":null,"work_id":"e3e3ace1-a889-46f3-9c2f-26ebf7916a77","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.546067Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:50aec9451ce38ff0684509baf1ae6a18c7b6268eec5db070bdfcdc66356aee50","observation_id":"1c861ece-909f-4f31-986f-0cdc4a790648","resolution":{"observed_at":"2026-08-10T14:17:01.447246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.430581Z","title":"Towards Evaluating the Robustness of Neural Networks","venue":null,"work_id":"0c85f69c-8dbf-4556-b533-95e8989d7233","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.550418Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:b39843895a7e69f1539da3f6ffd51f510d85d4226be4180bafb0a937a984d41d","observation_id":"486d65c3-5dec-40a6-911b-48eccb8660da","resolution":{"observed_at":"2026-08-10T14:17:01.435284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.417452Z","title":"Temporal Watermarks for Deep Rein- forcement Learning Models","venue":null,"work_id":"94d941b9-6ef1-47f3-8bd7-a1f5cd83bb26","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.553972Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:34758e3cce5662140ae96cf1924eddd7f5576555d6cea93cfc24c4b9fc4dceec","observation_id":"cfd7a5ac-f64a-4b0c-9863-139ff6b4dfda","resolution":{"observed_at":"2026-08-10T14:17:01.421488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.404208Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","venue":null,"work_id":"4aa75c02-4af4-444f-8951-25e699eca98c","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.557670Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:f0c153b9eaf8fdbddf788853b2148ff83579584b627ef8b3c59fa943d0fe5522","observation_id":"ff82d21a-f5a2-4ca0-ba59-d603c0643501","resolution":{"observed_at":"2026-08-10T14:17:01.408579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.392883Z","title":"BIRD: Generalizable Back- door Detection and Removal for Deep Reinforcement Learning","venue":null,"work_id":"17767bc8-2c75-48a6-a8c0-f488f71501ca","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.561205Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:c3132363e7ec58c48835a95cdad228874f20d414267db03f9293192218a605d8","observation_id":"6c1b2f6a-3a16-43e8-9b3e-a89ca8ee5cb6","resolution":{"observed_at":"2026-08-10T14:17:01.396613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.381969Z","title":"MARNet: Backdoor Attacks Against Cooperative Multi- Agent Reinforcement Learning","venue":null,"work_id":"05b50210-89bc-42f8-ac18-92dbe8d8a562","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.564834Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:3f4075888ac37ae91e10a46e1af84452f822c7d71c425b2ec864172e0c2b103d","observation_id":"3d94ad02-2c03-43c9-b62d-b76d57318cb4","resolution":{"observed_at":"2026-08-10T14:17:01.385683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.371201Z","title":"PyBullet, a Python Module for Physics Simulation for Games, Robotics and Machine Learning","venue":null,"work_id":"d51275d8-a0d7-4fde-b742-e113d780701e","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.568492Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:27344178f44c6024c44e281250f5641692a982ebbf71550238f89d3c70edf494","observation_id":"0b444267-fcba-4d84-9fcf-db18a52bc68a","resolution":{"observed_at":"2026-08-10T14:17:01.374831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.360390Z","title":"BadRL: Sparse Targeted Backdoor Attack against Reinforcement Learning","venue":null,"work_id":"0391c5c2-1caf-4827-a6e5-52903bfc994c","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.572379Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:e5b790cf655776af9163581892fb7ccc97dcc22a241fc9ad9831420ce3176477","observation_id":"b107571f-f300-41b7-b7e0-caf6d06ff81e","resolution":{"observed_at":"2026-08-10T14:17:01.364483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.349706Z","title":"Is Mamba Compatible with Trajec- tory Optimization in Offline Reinforcement Learning? In NeurIPS, 2024","venue":null,"work_id":"386095c0-24b6-44ba-baf1-df2f4796354e","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.575822Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:812ddab9e46a2361273345fa096d5ff05c92fc5082b8021a8341c7eee6d93d93","observation_id":"39f37a5e-62e7-4e8b-b852-164d318ac239","resolution":{"observed_at":"2026-08-10T14:17:01.353285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.339333Z","title":"Loss of Plasticity in Deep Con- tinual Learning","venue":null,"work_id":"ba096f54-f952-47eb-b64f-0a8954c769a9","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.579305Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:61119f58753af64b8bc2b81ad433e4b08135321050487ea06a31431021fbbff3","observation_id":"c389e5b2-8518-444d-bd25-6a9ea4e85c7e","resolution":{"observed_at":"2026-08-10T14:17:01.342857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.327962Z","title":"ORL- AUDITOR: Dataset Auditing in Offline Deep Reinforce- ment Learning","venue":null,"work_id":"8c11c711-cbbb-4797-a144-2268bcc80669","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.582850Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:0b9b5991214b6f9f2e825dcc7bf558a8d4670b9c07f2baaaed5cdf4dc26d334d","observation_id":"48e95b6a-3db7-4139-b249-2c4e87ccb510","resolution":{"observed_at":"2026-08-10T14:17:01.331929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.317957Z","title":"Discovering Faster Matrix Multiplication Algorithms with Reinforce- ment Learning","venue":null,"work_id":"8f4f4d29-8d8c-4057-994d-3f32e31d7bb2","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.586602Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:9e88863f88fad2a58dbbd49c40d8204032c9d795fb455f039eaad4466520880c","observation_id":"1c6395d9-86e4-4ec6-879f-78c7304d8243","resolution":{"observed_at":"2026-08-10T14:17:01.321362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.307407Z","title":"Adversarial Poli- cies: Attacking Deep Reinforcement Learning","venue":null,"work_id":"3f464423-d762-4270-b8ad-7f193db9d7f0","year":2020},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.590200Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:5795b77a0f5f6993cf047a04ce3633f3f9148e2b2fe06f6854bded3931c4625a","observation_id":"c2f45154-998c-431d-8d32-e3a152d77fb0","resolution":{"observed_at":"2026-08-10T14:17:01.311222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.294657Z","title":"BAFFLE: Backdoor Attack in Offline Reinforcement Learning","venue":null,"work_id":"a5a85342-2775-4f8d-b658-8348a6ddfbb0","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.593823Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:c6db3f33a6b3214ace6f9da683665c3ddece656c1b4bd8a58b72b4fb57cc5558","observation_id":"39ff92d2-6385-4429-9f8f-770fc78e9b50","resolution":{"observed_at":"2026-08-10T14:17:01.298685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.283465Z","title":"Adversarial Policy Learning in Two-Player Competitive Games","venue":null,"work_id":"c2b6faab-c2f3-436f-97d8-6bb2abadc791","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.597391Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:f360f2e60e0f184e75240b89141a183fff2c7810f9a9bd437c8ecb8fe18d98a7","observation_id":"8611f6a3-ac38-44a6-a98e-3bc1ece972c9","resolution":{"observed_at":"2026-08-10T14:17:01.287378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.270446Z","title":"SHINE: Shielding Backdoors in Deep Reinforcement Learning","venue":null,"work_id":"2515c48d-556d-4253-b7b6-fb811eb54455","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.601149Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:5ed0a3311e511a5906bdaacebdfc7641d59f137545a1553a7883ee2a9d26040b","observation_id":"7f26e739-d356-4dfa-8013-e9b655fbec93","resolution":{"observed_at":"2026-08-10T14:17:01.275279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.256641Z","title":"Adversarial Attacks on Neural Network Policies","venue":null,"work_id":"54949450-544f-4692-b79f-2fb65c942d70","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.604524Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:6aedb883b957c28301689bf396a5fc8a43e67ae94657848836e6438d671646d0","observation_id":"136e2621-dc69-447f-a319-9899e5a4f042","resolution":{"observed_at":"2026-08-10T14:17:01.260789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.244909Z","title":"The 37 Implementation Details of Proximal Policy Optimiza- tion","venue":null,"work_id":"2d0db4b6-c236-4a1e-b4d4-e30ebf3f7398","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.609814Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:391d4e1ed1f82e56538c3592ea6ce4724c2d100a2a9b6c17925350d2e0dd7367","observation_id":"f52627fb-5a26-4c07-97a9-c83f855077c1","resolution":{"observed_at":"2026-08-10T14:17:01.249285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.229533Z","title":"Highly Accurate Protein Struc- ture Prediction with AlphaFold","venue":null,"work_id":"8efc2b8e-7cec-4478-82f5-9ed8a6bcbf9b","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.613865Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:8201ee8f5289540db7e324e362657fe7c092092108e8c5d0571ba638e255caa4","observation_id":"3ede7755-b485-443c-8b5e-746496201712","resolution":{"observed_at":"2026-08-10T14:17:01.234451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.216230Z","title":"TrojDRL: Evaluation of Backdoor Attacks on Deep Reinforcement Learning","venue":null,"work_id":"41acb19b-ae81-483d-a8cc-00f52a7f0408","year":2020},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.617266Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:447c86fd30b0fbbd9055c725a869a6e845b6f44102943145c190a4119053b234","observation_id":"2cc96d21-9a17-476d-8bbb-cb14a58d73b5","resolution":{"observed_at":"2026-08-10T14:17:01.220033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.204014Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","venue":null,"work_id":"226ac00d-a563-48a9-9374-cae8c0151c32","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.620374Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:4a1afd8c2f9de35390e0970777cb7cb63b00ba09ba1ad4a7b59440bfc77e9c4c","observation_id":"2e760255-7b66-437e-9108-38bebb97b13a","resolution":{"observed_at":"2026-08-10T14:17:01.208038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.192493Z","title":"Combinatorial Optimization","venue":null,"work_id":"985e4219-9476-4c84-8a5a-7f948e5cc9cc","year":2011},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.623342Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:e949ec973b08dbd17a1270228d8736668e4fef56b1588d8707889e64807ca888","observation_id":"6e4b5cde-5c3c-49b5-a596-f27e96ff64dc","resolution":{"observed_at":"2026-08-10T14:17:01.196458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.180904Z","title":"On Infor- mation and Sufficiency","venue":null,"work_id":"ee11d4ae-72fa-4fb7-b42c-1865c1ef9e38","year":1951},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.627904Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:ccd5e0bb2aa86d56984a1e0e328f2214cb9bec316f27d4b1413a6afc1f56c27e","observation_id":"d392c0f5-56ae-4751-bacf-b2b3d052aa73","resolution":{"observed_at":"2026-08-10T14:17:01.184808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.169356Z","title":"Exploration in Deep Reinforcement Learning: A Survey","venue":null,"work_id":"7cf24e36-2c9b-4a36-8365-d8f2d2f89c1f","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.631739Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:24bb3c83c57588982b9928cc276c9c126614da497122a80af03ea39ad3c00d16","observation_id":"9dd3740e-2c3b-4341-9ecb-7c389f5c98ac","resolution":{"observed_at":"2026-08-10T14:17:01.173799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.158717Z","title":"Spatiotemporally Con- strained Action Space Attacks on Deep Reinforcement Learning Agents","venue":null,"work_id":"ebe7c0ff-9c11-49f2-96c6-0848f34d0ee9","year":2020},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.635279Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:a54d2905842925c3b2b85e4573c847f729de41d9d1d6d61619380387ca022f1d","observation_id":"7143d754-8bbf-4d32-8049-db3641bbe57f","resolution":{"observed_at":"2026-08-10T14:17:01.162469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.147046Z","title":"Online Poi- soning Attack Against Reinforcement Learning under Black-box Environments","venue":null,"work_id":"0c063af9-f287-4ec0-b195-ccc8777b46b9","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.639312Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:5bf9a8c371631a82598a887c4554a40bb50c769fa817e58b81d584d386569f12","observation_id":"203b8826-cd17-4729-be8d-ce3886ce5228","resolution":{"observed_at":"2026-08-10T14:17:01.151196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.130235Z","title":"Fine-Pruning: Defending against Backdooring Attacks on Deep Neural Networks","venue":null,"work_id":"6e197dd0-b699-4296-b7ba-16452444adea","year":2018},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.642958Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:2268799819e66f04163bba58259a36b32060f07f038dd471a4e4f9510fb1b754","observation_id":"b57c2ca8-4473-49a7-8932-58f6c6656a63","resolution":{"observed_at":"2026-08-10T14:17:01.137460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.117046Z","title":"Rethinking Adversarial Policies: A Gen- eralized Attack Formulation and Provable Defense in RL","venue":null,"work_id":"434aa055-1d7a-408b-8a78-1dea27e5c2d4","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.646504Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:4cdd2ff72cc702077ab8d0ff1c0f0b97a2c4f21db7072b0228c73ab36515acaf","observation_id":"5726928a-9a5e-451a-8c01-3de4f8e02a68","resolution":{"observed_at":"2026-08-10T14:17:01.120961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.103977Z","title":"HDRS: A Hybrid Reputation System with Dynamic Update Interval for Detecting Malicious Ve- hicles in V ANETs","venue":null,"work_id":"6f93905b-16d4-47ce-9935-99022f8ab337","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.650286Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:aef5ab2be8c2a7c92d9604cdd8fc99f225ad8cced47af65fc083bd4488daf87c","observation_id":"44188334-fccc-4df1-bf5a-84f3fd537e5f","resolution":{"observed_at":"2026-08-10T14:17:01.108682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.092769Z","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","venue":null,"work_id":"c1487049-f42d-4ea5-8182-1042988ff37a","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.653818Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:27bf30e3c7fc66f92eed63ca41cd761a4ac46b8ea0a9e074da2dd71e693c9927","observation_id":"92148fdb-b53b-46ec-8778-a08d77d21d23","resolution":{"observed_at":"2026-08-10T14:17:01.096643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.080680Z","title":"A Data- free Backdoor Injection Approach in Neural Networks","venue":null,"work_id":"bdefb02e-0b38-4de1-82d9-48914d3f050f","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.657403Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:672b61a374313ec1eff2cafe22b25c83d574ef72d8d59ff892ecc7b17eb71518","observation_id":"1c00c62f-733c-4bf6-920b-dc3c9c12947a","resolution":{"observed_at":"2026-08-10T14:17:01.085011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.068325Z","title":"ABM-V: An Adaptive Backoff Mechanism for Mitigating Broadcast Storm in V ANETs","venue":null,"work_id":"2b195ffd-3073-4223-9545-6fc4043a9e3c","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.661344Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:1913bd7b7c4825721890b5747074ea07012946d3776fcc9b4bfa1258fc9ca9d6","observation_id":"86bffef9-72b9-4f1c-b72c-c9c54f1670dc","resolution":{"observed_at":"2026-08-10T14:17:01.072321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.057531Z","title":"SUB-PLAY: Adversarial Policies against Partially Observed Multi- Agent Reinforcement Learning Systems","venue":null,"work_id":"d3e05df2-1fbe-49d2-8b26-38e361649866","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.664921Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:3ac45b7a9e3d8edee4b47b55f05053d6d5e5d83f09297fe6131b8dcec685948c","observation_id":"043b84d7-f2a4-448a-93b9-5aac1e3ec9a0","resolution":{"observed_at":"2026-08-10T14:17:01.061196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.046306Z","title":"Targeted At- tack Synthesis for Smart Grid Vulnerability Analysis","venue":null,"work_id":"126379dd-6aeb-4a2c-a78c-60f4b51cfcaa","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.668366Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:89e65780cbd0eeccdae6d60fe4be709e15e5a42d684182da7b02f2940c5b5eda","observation_id":"988a944c-9fab-4609-b4b6-00d3c7d12bfa","resolution":{"observed_at":"2026-08-10T14:17:01.050297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.033510Z","title":"Implicit Poisoning attacks in Two-Agent Reinforcement Learn- ing: Adversarial Policies for Training-Time Attacks","venue":null,"work_id":"079bc5da-665b-48ab-9b13-5e74d17c7a5d","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.671759Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:491e1682c59cfdc9f8c315c0cc6899bfbe726276e4390014b39441392e648300","observation_id":"221007f2-281d-4146-811c-7a67ec519d54","resolution":{"observed_at":"2026-08-10T14:17:01.038023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.020844Z","title":"Gym Documentation","venue":null,"work_id":"0b42010d-dd5c-431c-aa5f-0032ad82ac30","year":null},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.675417Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:e15fbaf287ddefa946ef528856c4de690ab518d1365dd336058f131face238da","observation_id":"b3531228-ebd9-40d1-a81c-38c3c1818d28","resolution":{"observed_at":"2026-08-10T14:17:01.024810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:01.010115Z","title":"Continuous Control with Deep Reinforce- ment Learning","venue":null,"work_id":"91315210-61cd-4f04-a1eb-d08bf12c2c39","year":2016},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.679036Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:1b2f523ef0dd3a39521f150763162270cc9e2c7e6ef0d875aab93e6dfa17e423","observation_id":"b744073d-2448-48ae-ad92-2c0d91e4316a","resolution":{"observed_at":"2026-08-10T14:17:01.013849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.995815Z","title":"Is Poisoning a Real Threat to LLM Alignment? Maybe More so Than You Think","venue":null,"work_id":"69fc42ec-cfc5-496d-bd68-4e82dbab9122","year":2025},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.682602Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:fe9ba47f3af317cf54951ee3c41411fa3e5515d79620dcf795f70c7184f1eda1","observation_id":"fc180226-4778-4832-aa14-bf103bbd1e59","resolution":{"observed_at":"2026-08-10T14:17:00.999586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.985106Z","title":"15 Stable-Baselines3: Reliable Reinforcement Learning Im- plementations","venue":null,"work_id":"eb5329b3-eb93-4ad2-aeb6-a1981e43b4a7","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.686148Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:849427b9f29fa46854d1c60fa911f6535bc574d8eb07e2bf495553e31cc2166f","observation_id":"c03dddb0-ee95-4986-a0e8-45e4caaf1cc4","resolution":{"observed_at":"2026-08-10T14:17:00.988773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.974063Z","title":"Reward Poisoning in Reinforcement Learning: Attacks against Unknown Learners in Unknown Envi- ronments","venue":null,"work_id":"84f894e4-bbbb-4273-a0e5-654b827d0e33","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.689714Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:9a18654ae12cfeecf33b6f4c6709997b87345b5f771022ebaccffc78222382c2","observation_id":"0bd73646-314b-4d3b-8126-f6337bdde81f","resolution":{"observed_at":"2026-08-10T14:17:00.978448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.963737Z","title":"SleeperNets: Universal Backdoor Poisoning Attacks Against Reinforcement Learning Agents","venue":null,"work_id":"ffe793ff-3b4e-40c2-88b6-781b333643b7","year":2024},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.692987Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:658ce4cbcbc4456c9e399da674427999259be931f129afdf0bc960abe2a619af","observation_id":"e9eceb8a-3bcc-488f-9608-e2829c590e74","resolution":{"observed_at":"2026-08-10T14:17:00.967427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.953182Z","title":"Proximal Policy Optimiza- tion Algorithms","venue":null,"work_id":"a76666bc-fbca-4569-bfcc-127b70a148c3","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.696424Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:9529a30fd9be4658da0665d683b76df80540c4bc4a9c67855f9ca1ecfe08fd73","observation_id":"c1cfd600-3308-4173-91f6-52dadf9af49e","resolution":{"observed_at":"2026-08-10T14:17:00.957083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.941894Z","title":"Fine-Tuning Is All You Need to Mitigate Backdoor Attacks","venue":null,"work_id":"c7ff33ec-e379-4fe0-9455-9455a1cf6a5f","year":2022},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.699717Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:7d426ab43792818f5000d093aee22c680c69c539f609628c5aa1afab942b1489","observation_id":"6a9674d5-db64-4da4-aef7-71e743b87b5a","resolution":{"observed_at":"2026-08-10T14:17:00.945644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.931872Z","title":"Backdoor Pre-trained Models can Transfer to All","venue":null,"work_id":"ac1b283a-2d2d-4a66-b604-12f45613f11e","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.702955Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:95b6d3897dcca2ce81f0f277278825205bf450c8585ef5beb7b931ce044dc578","observation_id":"0aeff815-22f8-4804-9c84-922ce9baa032","resolution":{"observed_at":"2026-08-10T14:17:00.935377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.921916Z","title":"Mastering the Game of Go without Human Knowledge","venue":null,"work_id":"49959a02-1648-47d2-a28c-b17bc64e4ef9","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.707005Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:05a22d2fcbd40e8750bffc3703ea03b3a9ff0bf0b8fa52731f6e20c387be8bce","observation_id":"0e14a2f5-e9f2-4779-953c-52733c66530c","resolution":{"observed_at":"2026-08-10T14:17:00.925547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.912131Z","title":"Stealthy and Effi- cient Adversarial Attacks against Deep Reinforcement Learning","venue":null,"work_id":"3eaf56ca-7f18-4345-9c2b-09758f17bf1a","year":2020},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.710401Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:b74e841770dcc2d9231729806bda94bd6c34d8536be36f2f0a05806f366bacad","observation_id":"65261f6c-742e-4022-8e9c-0a9ef3d7203f","resolution":{"observed_at":"2026-08-10T14:17:00.915446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.902083Z","title":"Reinforcement Learning: An Introduction","venue":null,"work_id":"4244cfd3-009c-4c6e-8226-cfd6f0afecef","year":2018},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.713834Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:e744df80e223e83f82e83d8663502b86a9067ad2c2156b19cbd8cbe0aa68849f","observation_id":"2898a059-aec0-490e-a843-1f6be231f7f6","resolution":{"observed_at":"2026-08-10T14:17:00.905937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.891549Z","title":"Demon in the Variant: Statistical Analysis of DNNs for Robust Backdoor Contamination Detection","venue":null,"work_id":"f5e955bb-27d3-4adb-afa7-d7fb0244884e","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.717229Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:06e5609f2e21af322d12e54452c1db6d81f7ac44f2f270aaa109237012dc5fa4","observation_id":"b5db0db7-f76f-4e33-a184-85f91ae9cf5c","resolution":{"observed_at":"2026-08-10T14:17:00.895485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.881698Z","title":"Distral: Robust Multitask Rein- forcement Learning","venue":null,"work_id":"f744e1d6-c73e-4e8b-b51a-31623fc326ab","year":2017},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.720542Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:a648aacf38b556a112f494a84defbff382a6a771f64136f587d459eae8b1fa99","observation_id":"262a741b-f0cd-446b-b572-2f58c95ab72b","resolution":{"observed_at":"2026-08-10T14:17:00.885126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.871188Z","title":"Ad- versarial Attacks on Multi-Agent Communication","venue":null,"work_id":"6910d667-830a-4631-85fb-d5cfc60073a4","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.724058Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:4fbc25dab30f43422785e2a7d7184391d753f2603766f72d0a86d4a7530bd665","observation_id":"b6796340-7375-4762-bf61-8d86b76c07c8","resolution":{"observed_at":"2026-08-10T14:17:00.874805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.860458Z","title":"A Survey of Multi-Task Deep Reinforcement Learning","venue":null,"work_id":"24939dd9-ac0c-4194-996a-4acb2be90b8a","year":2020},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.727352Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:e4313279c78f26eb7101b48a16433e1df17450edbdac97a6168f596409ed0a4b","observation_id":"fe3f3100-1575-4ead-8c2d-ee0ea52465f9","resolution":{"observed_at":"2026-08-10T14:17:00.864148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.850055Z","title":"BACKDOORL: Backdoor At- tack against Competitive Reinforcement Learning","venue":null,"work_id":"e6cbe349-b08a-4e91-adeb-9b6bcd8c4927","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.730691Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:62d4b2b0d7431ba56cd21a7bfe9db6a977f60804717ff85bf4d20f3250b173ed","observation_id":"48d6940b-7b7b-442d-a5b9-99c018817372","resolution":{"observed_at":"2026-08-10T14:17:00.853999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.838464Z","title":"Adversarial Policies Beat Superhuman Go AIs","venue":null,"work_id":"352bef06-5dd5-4ffc-abe3-d5de94a50ef1","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.734680Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:b11042565ac54fc0c24f248d53f0b3e21f2f81c38dffbc53df18c064472bedbe","observation_id":"792b8299-3d1d-4dcd-be68-e819d6d1df66","resolution":{"observed_at":"2026-08-10T14:17:00.842573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.825965Z","title":"Ad- versarial Policy Training against Deep Reinforcement Learning","venue":null,"work_id":"cc1027dc-8ef6-4105-9170-57463a12661e","year":2021},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.738022Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:f10e2db36c636448c5f488f830d51f2c4547d3e46b1ac5a69b94e4ef903a4a77","observation_id":"ba5ef6ab-4add-4a8a-9006-daf018b79303","resolution":{"observed_at":"2026-08-10T14:17:00.830631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.815189Z","title":"RLID- V: Reinforcement Learning-Based Information Dissem- ination Policy Generation in V ANETs.IEEE Transac- tions on Intelligent Transportation Systems, 2023","venue":null,"work_id":"44ad0e1a-876c-4313-9730-64dcd4791ac1","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.741200Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:ebe9574d28ac71ccadddc51239b579fd415f98605feec24fdc9bd0ef350c305a","observation_id":"41ed5753-1a15-4cc0-b3b6-271210ebef68","resolution":{"observed_at":"2026-08-10T14:17:00.819109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.803908Z","title":"Design of Intentional Backdoors in Sequen- tial Models","venue":null,"work_id":"c6b5dfa6-af4b-4853-90c2-bdec74babd4e","year":2019},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.745118Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:a0d66c92741727d436510a6491bac12524a124555a449d9339b7314888fa34e1","observation_id":"018daba4-b270-4cef-ae2a-29116f2a0a24","resolution":{"observed_at":"2026-08-10T14:17:00.807624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.793447Z","title":"Reinforcement Unlearning","venue":null,"work_id":"fa39cc7b-70f0-47ed-a026-0a05c3e0e9fd","year":2025},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.748600Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:b7e6848e278856596a0112ca2fa2fe3d53878fe0d7468029b948540ee7d15f4d","observation_id":"007b5f52-357d-406e-95f8-409795672620","resolution":{"observed_at":"2026-08-10T14:17:00.796996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:17:00.779216Z","title":"AIRS: Explanation for Deep Reinforce- ment Learning based Security Applications","venue":null,"work_id":"70df7535-9105-4159-8bab-bc13bbb2fe36","year":2023},"citing_paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T14:17:00.752013Z"},"links":{"citing_paper":"/paper/2501.15529"},"observation_digest":"sha256:eb4b3842e8880d3c9bea7700a22becd4f14738985688d5e0a49dc9b8df794157","observation_id":"7fd8b3a6-2367-460c-9be7-1753cee8200c","resolution":{"observed_at":"2026-08-10T14:17:00.785561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15529","last_updated":"2025-01-26T13:43:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T02:43:12.257485Z","submitted_at":"2025-01-26T13:43:39Z","title":"UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":63},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2501.15529."}