{"as_of":"2026-08-23T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64f075793f51f160cdd6cfad155f033a399007cfd0ef949d62459ec35b8156ae","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:55:50.831782Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13116/citation-record","integrity":"/paper/2411.13116/integrity","json":"/paper/2411.13116/citation-record.json","paper":"/paper/2411.13116"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.585610Z","title":"Deep reinforcement learning for financial trading using multi-modal features","venue":null,"work_id":"63b420d9-5916-44de-8ae7-0b37daec3dbc","year":2024},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.569295Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:808d2a70191f53a56085c1d09fa30bf774417f3ed7443a930b91dce86bc45bc6","observation_id":"5c9b08b0-f94a-4f7f-b4b9-df0db07a352a","resolution":{"observed_at":"2026-08-12T16:55:51.589852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.573464Z","title":"Vulnerability of deep reinforcement learning to policy induction attacks","venue":null,"work_id":"e6926867-effd-45dd-a0d5-bf00524466e7","year":2017},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.573848Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:87ed5801226ee0a4d701255397a5b091dd0fe741157620d61135744c291d0aac","observation_id":"2194d1bb-e10c-4a9a-ac98-7f8082d4b27d","resolution":{"observed_at":"2026-08-12T16:55:51.577529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.561539Z","title":"Simple physical adver- sarial examples against end-to-end autonomous driving models","venue":null,"work_id":"09ea3b3d-a526-48ce-ae44-24230eb76e32","year":2019},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.578167Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:2acbded95a058a3b0c7daad8020344746ec8311a3c8415209b48364654c27c45","observation_id":"e589d91b-b27d-4cd0-a5b1-44349fb3e6c1","resolution":{"observed_at":"2026-08-12T16:55:51.565481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.549394Z","title":"Dynamic regret of policy optimization in non-stationary environments","venue":null,"work_id":"a8f5d5c0-9355-43ee-b52d-18d20fada5a8","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.582915Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:12698e9eeaefb9732dc35d92ff2da6ac4bc980ad7e3b029d30bd5301ea7027e5","observation_id":"87b4f1b1-5d6d-4634-af1f-027fa7513b2c","resolution":{"observed_at":"2026-08-12T16:55:51.553656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00762","last_updated":"2022-07-28T17:30:20Z","snapshot_observed_at":"2026-08-16T17:30:33.188111Z","submitted_at":"2022-01-03T17:09:32Z","title":"Execute Order 66: Targeted Data Poisoning for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00762","snapshot_observed_at":"2026-08-12T16:55:50.587112Z","title":"Execute order 66: Targeted data poisoning for reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.587112Z"},"links":{"cited_paper":"/paper/2201.00762","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:00240c2a46a6ab4b1ea160a15a97c8be7dc091f26a0907c3dd3d888854964c0c","observation_id":"b5b46856-d2b2-4da0-ab76-11c9482968d0","resolution":{"observed_at":"2026-08-12T16:55:50.587112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.591968Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.591968Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:21489f4849cf27e746da0c9cb2e954b247df3c3ef534b8f5c0672a98227c8343","observation_id":"1754716b-14f1-437f-9902-4be21b8fdb2d","resolution":{"observed_at":"2026-08-12T16:55:50.591968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.531130Z","title":"A practical guide to multi-objective reinforcement learning and planning","venue":null,"work_id":"b9bb050e-175c-4410-bc3b-7ed63845d174","year":2022},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.604809Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:19786e4554f8e8e70f2f4bf4fadf6eb3a40f06860c611727cf16d525e01e9e28","observation_id":"85c030a6-cd4c-4eb7-95d3-0642087f9480","resolution":{"observed_at":"2026-08-12T16:55:51.535047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02787","last_updated":"2018-07-08T09:17:09Z","snapshot_observed_at":"2026-08-17T14:34:27.368185Z","submitted_at":"2018-07-08T09:17:09Z","title":"Financial Trading as a Game: A Deep Reinforcement Learning Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02787","snapshot_observed_at":"2026-08-12T16:55:50.610643Z","title":"Financial trading as a game: A deep reinforcement learning approach","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.610643Z"},"links":{"cited_paper":"/paper/1807.02787","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:a7fed7b467c756d4e6f0945ddbd65a12e31e99dadeb806948e1e3a03aedb5806","observation_id":"5e9eab07-bf96-4438-b3fa-47cf2925cfed","resolution":{"observed_at":"2026-08-12T16:55:50.610643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-08-14T21:17:29.796866Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-12T16:55:50.615717Z","title":"Adversarial attacks on neural network policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.615717Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:22267d3597072ca51a2a8ad5f3c7ca2c49e5daace651edf9412b81268e14e384","observation_id":"f99fba14-75ce-41e5-bd02-1e543e906158","resolution":{"observed_at":"2026-08-12T16:55:50.615717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.518913Z","title":"Deceptive reinforcement learning under adversarial manipulations on cost signals","venue":null,"work_id":"447f4cfd-2476-4fba-882e-66d42a01a4e2","year":2019},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.620115Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:1ac3f39cf54ff8a252f634e7b8c93c81c6b00bdbba600de0378fa2de836d1409","observation_id":"a74b81ed-1ddd-408f-822c-24ee89350b11","resolution":{"observed_at":"2026-08-12T16:55:51.523009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.624542Z","title":"Challenges and countermeasures for adversarial attacks on deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.624542Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:71f0d5d54df2f079369594c9c5b573b03e02de543a33494e1f300721669a6ecc","observation_id":"15cb4463-26a6-4346-8047-a53d7412e39a","resolution":{"observed_at":"2026-08-12T16:55:50.624542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.628720Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.628720Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:acffd82dfbdb3483b857518556ee5e6501a73140714f1a512b29f49715240b7a","observation_id":"440ba23b-acb8-4b6f-b886-aeeb56b3db64","resolution":{"observed_at":"2026-08-12T16:55:50.628720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.492283Z","title":"Query-based targeted action- space adversarial policies on deep reinforcement learning agents","venue":null,"work_id":"7d37b966-647d-4be3-9296-12e4ef601649","year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.632627Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:913609cce7705e972daa20819bebfebfe9480b9b479b957b24761597ef5eb243","observation_id":"efd045a2-8c08-4dd4-9f9d-d1ee1d296d66","resolution":{"observed_at":"2026-08-12T16:55:51.496355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.480769Z","title":"Spatiotemporally constrained action space attacks on deep reinforcement learning agents","venue":null,"work_id":"6b6d4468-7954-478e-9531-e7a2cc0ba2e7","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.637518Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:9e2f08dc500b77746c2fbbf803090fdacf90941631765a3fc59e6904beed61a4","observation_id":"831ec55c-9f2a-430b-81a0-c6a81200a16b","resolution":{"observed_at":"2026-08-12T16:55:51.484719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-12T16:55:50.641740Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.641740Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:fe17a650f7ad93356f0edb202df5c90b471fdb646cd701659f99b1200ac0025a","observation_id":"83e8a710-3f69-419e-af75-99e964dccc54","resolution":{"observed_at":"2026-08-12T16:55:50.641740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.06748","last_updated":"2019-11-13T01:24:00Z","snapshot_observed_at":"2026-08-21T01:10:13.587772Z","submitted_at":"2017-03-08T04:39:34Z","title":"Tactics of Adversarial Attack on Deep Reinforcement Learning Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.06748","snapshot_observed_at":"2026-08-12T16:55:50.647318Z","title":"Tactics of adversarial attack on deep reinforcement learning agents","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.647318Z"},"links":{"cited_paper":"/paper/1703.06748","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:63d4d40dd6855ec4a4043eccc51f17db6af1203aec057f22d4a5954b6cbd70a1","observation_id":"ed6e120d-bc8b-47f4-8dc0-9e97ebf29361","resolution":{"observed_at":"2026-08-12T16:55:50.647318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.654742Z","title":"Provably efficient black-box action poisoning attacks against reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.654742Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:5b8c090335f0b52b3c73b8ecf18c4b2379f69e33dc69ee6da613f831c4b712d0","observation_id":"972aedc4-229b-46ec-93e9-4f9b700432a8","resolution":{"observed_at":"2026-08-12T16:55:50.654742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.461900Z","title":"Efficient adversarial attacks on online multi-agent reinforcement learning","venue":null,"work_id":"820492c7-89f5-4af0-8328-4af97eb43748","year":2024},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.659305Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:a1a4a6bd52f4ef100a7efe61c7a7d184e87fb4098333336b64f4cb1e6d5feaa1","observation_id":"cbed4a31-c0d8-49c2-8243-8c732c1ecfbd","resolution":{"observed_at":"2026-08-12T16:55:51.465765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.449798Z","title":"Data poisoning attacks in contextual bandits","venue":null,"work_id":"13121c12-90c8-421d-b14c-3d7ffa1e4d81","year":2018},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.663497Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:b7a5c29ce4c64defbac75ef385c19150cbcb1b0a1df8960fe77b6539b5260d52","observation_id":"5250666e-5dfc-4c77-93f0-189da10bc084","resolution":{"observed_at":"2026-08-12T16:55:51.453931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.667933Z","title":"Policy poisoning in batch reinforcement learning and control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.667933Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:95221367ccf822ad80b4729fa3d145ef9f73e731863f0597af40c101e662a681","observation_id":"8c586906-bef4-4a40-ac42-df693a73d6c3","resolution":{"observed_at":"2026-08-12T16:55:50.667933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06587","last_updated":"2021-02-12T15:53:48Z","snapshot_observed_at":"2026-08-16T18:45:57.516276Z","submitted_at":"2021-02-12T15:53:48Z","title":"Disturbing Reinforcement Learning Agents with Corrupted Rewards","version":1},"cited_work":{"arxiv_id":"2102.06587","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.06587","snapshot_observed_at":"2026-08-12T16:55:50.935665Z","title":"Disturbing Reinforcement Learning Agents with Corrupted Rewards","venue":"cs.LG","work_id":"7e3d98e9-3727-45cd-b5b0-b9d694b4166c","year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.671820Z"},"links":{"cited_paper":"/paper/2102.06587","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:896462c1c599f7f8db2d1e95f7cd060be59524e40cd4d6d50540ca84c48ec04c","observation_id":"60ec42e5-d81b-47b2-9098-175a027d6158","resolution":{"observed_at":"2026-08-12T16:55:50.941231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.430933Z","title":"Inverse filtering for hidden markov models with applications to counter-adversarial autonomous systems.IEEE Transactions on Signal Processing, 68:4987–5002, 2020","venue":null,"work_id":"774d6aac-fcfe-4ad7-9112-2775f2e8db0f","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.676437Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:64ac1579141539b2db1bb7773e7928214b52d436eabde043ab457e92d342e45b","observation_id":"d5ee7621-6529-4315-940b-8faba8c76577","resolution":{"observed_at":"2026-08-12T16:55:51.435204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.419773Z","title":"Optimal attack and defense for reinforcement learning","venue":null,"work_id":"86971476-322c-4f82-8680-d37faa6c97a0","year":2024},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.679982Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:e282f17d0c362f87fa7a6275ec1143621dd7741b0e61f2b86bb7be1e05fa25f5","observation_id":"bf150143-5bea-4a9d-b675-1e4a10f6b13e","resolution":{"observed_at":"2026-08-12T16:55:51.423657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09470","last_updated":"2022-02-16T23:25:01Z","snapshot_observed_at":"2026-08-14T16:03:57.433380Z","submitted_at":"2019-07-21T22:00:24Z","title":"Characterizing Attacks on Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09470","snapshot_observed_at":"2026-08-12T16:55:50.684372Z","title":"Characterizing attacks on deep reinforcement learning","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.684372Z"},"links":{"cited_paper":"/paper/1907.09470","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:82401f7db9f47c38a57417eff2561a2e70bda987a3183370ba211c817e3721b6","observation_id":"8f96afad-9eaa-4624-b933-8d6abc192d86","resolution":{"observed_at":"2026-08-12T16:55:50.684372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.408051Z","title":"Continuous state-space models for optimal sepsis treatment: a deep reinforcement learning approach","venue":null,"work_id":"8ac2815a-02f5-4906-bf3d-39c7f4244767","year":2017},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.688931Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:7fba60e7417d22ce0aedf1e082680f7b174fc571d1364fa940e220d9e236f4cf","observation_id":"2a595077-d822-4ed5-a9b3-6d0fe9cd7b76","resolution":{"observed_at":"2026-08-12T16:55:51.412199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T16:55:50.693847Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.693847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:d44c4fe7d83f1b3cabde53571cc43adb5f7ec250cc6f585b992d5b897ddfb749","observation_id":"5a11c408-7de9-4fce-b400-350d3dec5088","resolution":{"observed_at":"2026-08-12T16:55:50.693847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.00774","last_updated":"2022-02-15T22:18:13Z","snapshot_observed_at":"2026-07-06T09:52:06.977995Z","submitted_at":"2020-09-02T01:43:30Z","title":"Vulnerability-Aware Poisoning Mechanism for Online RL with Unknown Dynamics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.00774","snapshot_observed_at":"2026-08-12T16:55:50.697615Z","title":"Vulnerability-aware poisoning mechanism for online rl with unknown dynamics","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.697615Z"},"links":{"cited_paper":"/paper/2009.00774","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:183e2664b08c1e82e11927afeda908726dc579bd8a0138f7a5a5d42dda143687","observation_id":"90e98eec-8362-489a-9bbe-2eabd7fae982","resolution":{"observed_at":"2026-08-12T16:55:50.697615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.395301Z","title":"Robustifying reinforcement learning agents via action space adversarial training","venue":null,"work_id":"bb0f5941-86ac-4097-babb-770569574827","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.704161Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:2e889973f8956f24b47e70977ef7dabfd34ba966dd43b4bb9fedfb509e6c37a4","observation_id":"c274a7d4-faae-40cb-86d1-75e4904bbd0f","resolution":{"observed_at":"2026-08-12T16:55:51.399984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.380946Z","title":"Adversarial black-box attacks on vision-based deep reinforcement learning agents","venue":null,"work_id":"88050e72-fce3-4f99-b299-62fe32e6ee59","year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.709425Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:280497347673aabaa07f30a25a093ec2826996e95516c3b6d96c988ec2ed6111","observation_id":"100b06c0-d12c-43b4-a56f-33223b70a094","resolution":{"observed_at":"2026-08-12T16:55:51.385637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.368310Z","title":"Action robust reinforcement learning and applications in continuous control","venue":null,"work_id":"a196a08c-bc13-4ebd-9820-c56018e5c101","year":2019},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.714465Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:a4d5141a48b5a7f36daad9beddf2886889dfcc3043b93185e00a2aebc1b3afbb","observation_id":"b8baee31-b61d-4f9a-9763-5763eea20cc2","resolution":{"observed_at":"2026-08-12T16:55:51.372625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.356251Z","title":"Freedman’s inequality for matrix martingales","venue":null,"work_id":"21c15a74-a7ef-4f2e-ac0d-ab154b63c886","year":2011},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.718413Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:dac574cd6f53394368db5a16afe0fafd3470960f262b272036e0b091c5ea8e61","observation_id":"cd1d1718-5f70-4e18-81da-564c2b341a2d","resolution":{"observed_at":"2026-08-12T16:55:51.360307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01888","last_updated":"2023-03-07T23:36:04Z","snapshot_observed_at":"2026-08-16T16:55:23.335641Z","submitted_at":"2022-06-04T03:15:57Z","title":"Reward Poisoning Attacks on Offline Multi-Agent Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2206.01888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01888","snapshot_observed_at":"2026-08-12T16:55:50.878457Z","title":"Reward Poisoning Attacks on Offline Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"0bb439bb-391f-4823-854c-cc3d15dcf58d","year":2022},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.722709Z"},"links":{"cited_paper":"/paper/2206.01888","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:e2c09dbaa00c1078a03859e9ed299409ea49d95035ceba7c88748662e7af6cbc","observation_id":"bf9367eb-1240-49ab-bbd5-937ee82bc7d3","resolution":{"observed_at":"2026-08-12T16:55:50.884663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.344103Z","title":"Transferable environment poisoning: Training-time attack on reinforcement learning","venue":null,"work_id":"d21685ca-f543-4f65-91ea-198b528b7887","year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.727097Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:491a7871f45e6d884fe5987252dda7ecfde028aaec1a8467583668d764f691e1","observation_id":"6488b0a3-0aeb-4d06-a092-aa257a7d2d93","resolution":{"observed_at":"2026-08-12T16:55:51.348530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.332089Z","title":"Prediction- guided multi-objective reinforcement learning for continuous robot control","venue":null,"work_id":"d710cc2f-0d48-40ae-8a02-ea7e5718e021","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.733605Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:f9012a28512856a225865659e781b69dfeab06b447a7b6d29fb6f10971227203","observation_id":"5b8915fd-f881-4d8c-b77d-74d7528dd889","resolution":{"observed_at":"2026-08-12T16:55:51.336198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.319157Z","title":"Enhanced adversarial strategically-timed attacks against deep reinforcement learning","venue":null,"work_id":"07fe414a-adae-4ee9-b12b-66a9bfacb480","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.738148Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:4e93460bde6f0cc63657ac71569dd411d0edac5d42dc8427c277c04abe890703","observation_id":"2da10514-5ebc-4834-a531-4dc1bb611ce4","resolution":{"observed_at":"2026-08-12T16:55:51.323500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:50.742968Z","title":"Reinforcement learning in healthcare: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.742968Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:f3577127dd0b6443bcc8e59e4fbc4a3edc64e526bbd857cca87fd8d9c156ba46","observation_id":"23a793b4-5c98-4410-b47f-efa4cb3d904f","resolution":{"observed_at":"2026-08-12T16:55:50.742968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08452","last_updated":"2021-01-21T05:38:52Z","snapshot_observed_at":"2026-08-18T05:57:55.253265Z","submitted_at":"2021-01-21T05:38:52Z","title":"Robust Reinforcement Learning on State Observations with Learned Optimal Adversary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08452","snapshot_observed_at":"2026-08-12T16:55:50.748765Z","title":"Robust reinforcement learning on state observations with learned optimal adversary","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.748765Z"},"links":{"cited_paper":"/paper/2101.08452","citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:3e537e979be50dcd38cd03888975cbedf75cb89328567e51a1f5c0650c8e069a","observation_id":"bfd34c65-561e-4b53-b2ea-562122a737f2","resolution":{"observed_at":"2026-08-12T16:55:50.748765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.295565Z","title":"Adaptive reward-poisoning attacks against reinforcement learning","venue":null,"work_id":"9dac4ed2-ae19-40e6-be6f-1fa6d5a7528f","year":2020},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.754896Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:70623ad1db6166ebdff43fabd5e9b0bbfb57b6a8c77203b5f2a7bb2aac048942","observation_id":"6b4a6a1b-9d95-4bdb-8c05-d34084839453","resolution":{"observed_at":"2026-08-12T16:55:51.300627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.280854Z","title":null,"venue":null,"work_id":"c8e95818-9926-44a2-ad35-ba9c532be497","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.760021Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:05e40d6041b1fbd7805346e638946dc09f80f2c273fb458f85bf2a81bb3ac2fe","observation_id":"d13c121c-cb27-41a2-ac3b-2b828734e488","resolution":{"observed_at":"2026-08-12T16:55:51.285430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.266438Z","title":"For episode k, V o 1(sk","venue":null,"work_id":"504ad9de-3440-456b-a9b4-4b1c12037015","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.764469Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:984dbdfab9e1010d2b3a6c65148abb9d5b2ee551157f9f5ef3ee2aba5b7739fe","observation_id":"461c5c04-2bb3-4adb-8613-58b756f222ef","resolution":{"observed_at":"2026-08-12T16:55:51.271055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.254107Z","title":null,"venue":null,"work_id":"64010c40-6293-4c71-a370-e2d12f957823","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.768583Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:50c34cf3676865348276d21de8336dd06434a38983a4f108b6efb79145aafc83","observation_id":"6bb0762c-fe4a-429d-9b3e-d1f8d5483635","resolution":{"observed_at":"2026-08-12T16:55:51.258178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.240037Z","title":"= E \" HX h=1 ∆ k h|F k 1 # where F k h represents the σ-field generated by all the random variables until episode k, step h begins","venue":null,"work_id":"8da53e99-18f5-4921-9c9b-b3ced510ddf1","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.772906Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:b91b5ca48690feceb648c6ed5bb853eaabbbf5fd5a63553bc0ed4233214a1902","observation_id":"f7bc9275-1bc8-46ec-abf7-96355b336827","resolution":{"observed_at":"2026-08-12T16:55:51.245807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.226322Z","title":"(9) Next, we will show that with a probability at least 1 − δ2, we have KX k=1 HX h=1 ∆ k h ≤ KX k=1 V o 1(sk","venue":null,"work_id":"12ea2240-4d59-49e2-ab59-bac026c18436","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.777709Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:565b80f26d0d316f955dd1c1283ab46813846565aa1d8f475a937fd559fca6cb","observation_id":"fb27b520-79d3-4255-935a-1dc9620c62eb","resolution":{"observed_at":"2026-08-12T16:55:51.230722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.194373Z","title":"(10) Since E hPH h=1 ∆ k h|F k 1 i = V o 1(sk","venue":null,"work_id":"cc6ad730-e463-4c94-85d5-bbadf0152c1d","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.786269Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:0ce7a54a33ac4ee3b458400ae97ce3267dae968e0dcc9ffd5c936db76b8b7652","observation_id":"8595aea2-ba7a-48bb-a698-bb86503f6044","resolution":{"observed_at":"2026-08-12T16:55:51.198701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.181540Z","title":null,"venue":null,"work_id":"efb6c87d-ef4d-4860-ae8d-f4ce551f8e36","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.789842Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:dd47a47617ec867a7ed22ea96788880e3ec406100f3aff182671ca33ca222393","observation_id":"c1ba3183-1edb-4fed-a9d5-272fd0b31cd1","resolution":{"observed_at":"2026-08-12T16:55:51.185502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.166577Z","title":null,"venue":null,"work_id":"9abacb1d-00ce-4800-8666-ecb27fcc8e89","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.793591Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:ddd9604cafb34bf5d384f4db7c8e5ec8da7eba3e391f1abf663b973360d86b38","observation_id":"7d369ba3-877b-4523-ac47-a23b6aaaccf5","resolution":{"observed_at":"2026-08-12T16:55:51.171717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.150559Z","title":"HX h=1 ∆ k h 2 |F k 1 # ≤ H 2 KX k=1 E","venue":null,"work_id":"22b7d132-f017-45ef-8d3d-b32cff3220d9","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.797391Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:79832077b300923f4ce5d46c8b58001b2d5f8dfd811c25b37091b29898f2d260","observation_id":"fe41ac63-ffce-461e-a375-7082a7728cd8","resolution":{"observed_at":"2026-08-12T16:55:51.155576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.134672Z","title":"(13) By Freeman’s inequality [31], we have P  YK = KX k=1 Xk > 2H 2 vuutln(1/δ2) KX k=1 V o 1(sk","venue":null,"work_id":"483b6346-6b8e-4d5f-aaf1-9f3b44994471","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.800964Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:71fccb744d32021a588ac4acfe7dbf304455f1f37445bd64cd7d99c721d53971","observation_id":"57917e03-baee-47e2-bca0-d36a03da0e1a","resolution":{"observed_at":"2026-08-12T16:55:51.141215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.117475Z","title":null,"venue":null,"work_id":"c4c479ef-c5e0-467e-a4cf-f416fe25376e","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.804695Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:6cd5f50108efe01dc6b0aa4cdd456f902d73fa656d424f45dfea40d527a58934","observation_id":"a6ec0305-8d00-43bb-a4c3-cdf0b23251ad","resolution":{"observed_at":"2026-08-12T16:55:51.122201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.103861Z","title":null,"venue":null,"work_id":"50ef576e-05a5-4ad2-a116-0f578ba045bd","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.808671Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:42945eda11655aca78184f0f89000c1a7ca8617e660554fa803d3e23ed44656e","observation_id":"7e269d5c-6b2b-4b95-b03d-f42cf22fbdda","resolution":{"observed_at":"2026-08-12T16:55:51.108814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.090915Z","title":"2βh k (T h D,I (k), δ1)2T h D,I (k)2 −T h D,I (k)(H − h + 1)2 # = HX h=1 MX m=1 X (D,I )∈T h k kX T h D,I (k)=1 2 exp","venue":null,"work_id":"169325ce-0e1c-42d6-89c0-e50011cb4ec2","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.812588Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:4d2899fb795a561c187200d5c8f436e9facbb39503bb8f6e55ee0a34d2ef15bb","observation_id":"bd38d6e0-ae72-4159-8703-d18999918267","resolution":{"observed_at":"2026-08-12T16:55:51.095384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.208727Z","title":null,"venue":null,"work_id":"552cd414-c2dd-418e-a3fe-4d9d2abcd6c0","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.816700Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:83c611d7debeeea13b4a6c5a02fb9fb2d9e1a2f1d62102e751978507617fff6b","observation_id":"3ce4235a-5b24-48a1-8285-89a1a0cb88e3","resolution":{"observed_at":"2026-08-12T16:55:51.213685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.078056Z","title":null,"venue":null,"work_id":"b38fc606-7284-4b42-a55c-8fe51ac6c9e2","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.820525Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:73099086f6d794f540ee442c931bf44173ba8b24226d5aca2272f89fca03a2fb","observation_id":"a7e4570c-13a3-436e-8cb7-1a27febd4ea3","resolution":{"observed_at":"2026-08-12T16:55:51.082431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.062237Z","title":null,"venue":null,"work_id":"b520851b-e28e-40b2-be2a-c7f8e97a186b","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.824086Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:030ffbf37de98316c2e1bfb56ff453daa14296faf228ba13192a4ca17e3631f7","observation_id":"e66a67d5-3b14-4c86-9a16-97175e97ba7e","resolution":{"observed_at":"2026-08-12T16:55:51.067131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.049018Z","title":null,"venue":null,"work_id":"6f88d0bd-1283-45c2-a7ad-29c464ef1207","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.827740Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:0cf03dfcf8958f347b6462678e5bfb4706602b533163cc3e81ae8d2a7719f7d3","observation_id":"1bd0e7de-2af2-477b-af84-8588ec6b2317","resolution":{"observed_at":"2026-08-12T16:55:51.053984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:55:51.034467Z","title":"K · ν2 1 · 2 − ρ2 (H − h + 1)2 · ln (6M H/δ1) + 1 # + 1. (28) Through 2Dm+1 − 1, we get the upper bound of the node number of tree T h K, i.e., T h K ≤ 4","venue":null,"work_id":"ecdfc40b-b70b-46b9-86af-7048fedd2579","year":null},"citing_paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:55:50.831782Z"},"links":{"citing_paper":"/paper/2411.13116"},"observation_digest":"sha256:4e1238814df035fdaaabb4578c471591082f956832a98e2f76fd3c0ac81a2206","observation_id":"2fff036a-ba44-4ef1-a680-33e4beec0b7e","resolution":{"observed_at":"2026-08-12T16:55:51.039430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13116","last_updated":"2024-11-20T08:20:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T18:44:39.022808Z","submitted_at":"2024-11-20T08:20:29Z","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2411.13116."}