{"as_of":"2026-08-23T16:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01d79aaf055b14cbde7cbb76a0e6ed9b6ce93d541ab51d210544e49ec2b3a836","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:06:17.785227Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00797/citation-record","integrity":"/paper/2412.00797/integrity","json":"/paper/2412.00797/citation-record.json","paper":"/paper/2412.00797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.07798","last_updated":"2021-06-14T23:16:41Z","snapshot_observed_at":"2026-08-16T18:17:10.216212Z","submitted_at":"2021-06-14T23:16:41Z","title":"Poisoning Deep Reinforcement Learning Agents with In-Distribution Triggers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07798","snapshot_observed_at":"2026-08-12T05:06:17.702243Z","title":"Poisoning deep reinforcement learning agents with in-distribution triggers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.702243Z"},"links":{"cited_paper":"/paper/2106.07798","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:02ec0bc6615b0f48a1d779c126943de44c83ff7757d7b5eb9bc436130d288c69","observation_id":"2ff4956e-cf40-4681-81ca-f49ab971a10c","resolution":{"observed_at":"2026-08-12T05:06:17.702243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.053452Z","title":"Generative adversarial user model for reinforcement learning based recommendation system","venue":null,"work_id":"2e6fadee-d434-4bf8-8c81-22c88b1c9074","year":2019},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.707053Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:fcc7612f4fcbf917e3f5047a58d2eb306bba0ee43406cb7d323891618b4ad0aa","observation_id":"c68d1b09-12d3-4888-aaae-d2393111f98e","resolution":{"observed_at":"2026-08-12T05:06:18.057832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.041373Z","title":"Badrl: Sparse targeted backdoor attack against reinforcement learning","venue":null,"work_id":"d5227a56-68bb-4a64-a3ce-af36d67aa6b6","year":2024},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.710925Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:0a1ebd1634c8340e8692395f38d6cb26e3f6ff2ff4e354d95e5c47ee92e2cabf","observation_id":"704bf826-e375-4c48-b521-d22a1e19098b","resolution":{"observed_at":"2026-08-12T05:06:18.045521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.028528Z","title":"Sbeed: Convergent reinforcement learning with nonlinear function approximation","venue":null,"work_id":"71461459-7695-4f7d-86db-dd6a5aac94d0","year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.715067Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:f15cd8adc1dc6b0b00b2b4d58254c32a00321441a55ea33ddc2bda8fc9d15030","observation_id":"a871d55a-873a-4269-a5d4-a37e1ffb337c","resolution":{"observed_at":"2026-08-12T05:06:18.032843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00762","last_updated":"2022-07-28T17:30:20Z","snapshot_observed_at":"2026-08-16T17:30:33.188111Z","submitted_at":"2022-01-03T17:09:32Z","title":"Execute Order 66: Targeted Data Poisoning for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00762","snapshot_observed_at":"2026-08-12T05:06:17.719254Z","title":"Execute order 66: targeted data poisoning for reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.719254Z"},"links":{"cited_paper":"/paper/2201.00762","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:2b88672b526b56e8ededca2a67b6a11b9b3536cfb29bb80541acb8fb20fe7d32","observation_id":"13d8d294-c30b-45fa-8541-a0a169c0fe0e","resolution":{"observed_at":"2026-08-12T05:06:17.719254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-08-16T15:51:37.195604Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-12T05:06:17.723470Z","title":"Approximation methods for bilevel programming","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.723470Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:c134cf162decbbade769fe4973d0f0c325c16f5bf07dacdcbf36ca8d0db7203e","observation_id":"5c54d4ff-aa9e-4904-816b-60c18f990911","resolution":{"observed_at":"2026-08-12T05:06:17.723470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.00633","last_updated":"2016-11-23T10:23:25Z","snapshot_observed_at":"2026-08-14T21:36:58.983526Z","submitted_at":"2016-10-03T16:52:10Z","title":"Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.00633","snapshot_observed_at":"2026-08-12T05:06:17.728031Z","title":"Deep reinforcement learning for robotic manipulation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.728031Z"},"links":{"cited_paper":"/paper/1610.00633","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:1f64e1f3eba97e04ba167fce078225044495c0d541a116417633f74756b088e1","observation_id":"29d0671b-1e8d-4027-b350-22a82b9471e7","resolution":{"observed_at":"2026-08-12T05:06:17.728031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.732094Z","title":"A two-timescale stochastic algorithm framework for bilevel optimization: Complexity analysis and application to actor-critic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.732094Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:d45fd78d48ba532494643036f8bc1b2745e26e5c26537d26f7de78b6275c9dba","observation_id":"9d6f5cf8-2cfb-4436-9391-8fd2eed573ec","resolution":{"observed_at":"2026-08-12T05:06:17.732094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.008544Z","title":"Trojdrl: evaluation of backdoor attacks on deep reinforcement learning","venue":null,"work_id":"b11917a1-7068-45a0-8a34-11487115b6c7","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.735722Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:5837f9e400462c08ff8295f4d1a38f95690a0152a6f24b0f75d52a15ca080bdd","observation_id":"d9c94093-48fe-47ca-a667-d55e4d4d7001","resolution":{"observed_at":"2026-08-12T05:06:18.012764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.996425Z","title":"Provably efficient black-box action poisoning attacks against reinforcement learning","venue":null,"work_id":"881c33f9-467d-4134-aa80-0fd33c39ec71","year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.739222Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:6292e2ed0b4f2ab8861ddbdc348d6335383f0cd0f4688cbfa8e1368275e4c5ab","observation_id":"f5eb3cf2-a93c-4ec8-8f91-56c54c51dad3","resolution":{"observed_at":"2026-08-12T05:06:18.000623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.983528Z","title":"Efficient adversarial attacks on online multi-agent reinforcement learning","venue":null,"work_id":"812fd2ec-3d6a-493b-8335-01bd2e8ca6c3","year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.742890Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:0991c90fc0ce71065f0039d68ec3d5f6abd7426e8b694ef748fe2bbde2b02eee","observation_id":"a2fabc64-2446-4206-8a12-9b7eaa5b83d4","resolution":{"observed_at":"2026-08-12T05:06:17.988384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.972410Z","title":"Policy poisoning in batch reinforcement learning and control","venue":null,"work_id":"8cc39e31-1216-402b-9d5a-253c529bc3ca","year":2019},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.746457Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:215ecf234cc2d7493a06b703033124c27fd4f9cc3cb208401c459f1c3780c337","observation_id":"e6c6f464-8ad7-41a7-ae5a-cef4bfc6b3eb","resolution":{"observed_at":"2026-08-12T05:06:17.976154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.961127Z","title":"Convergence rate of a penalty method for strongly convex problems with linear constraints","venue":null,"work_id":"79b13fb6-a2b8-41a5-81f2-60a479c2d7cb","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.751168Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:5a94ba8a60168c200ef3b5bcda0b0716e68e2426bc9be3a10ed03d191e14f4b0","observation_id":"f1c55176-5fd0-4294-891c-62c35bb6c369","resolution":{"observed_at":"2026-08-12T05:06:17.964954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.949404Z","title":"Talking to bots: Symbiotic agency and the case of tay","venue":null,"work_id":"e8c4204d-dd6d-49bd-aaa2-d4b0e18c5d32","year":2016},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.754766Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:f90197bcdd03cccb7b146f61eedd0c1021d4d0f98d8fe46d34f8a71e63255273","observation_id":"b7ee0310-a4c2-4cf3-8400-043d11d4804e","resolution":{"observed_at":"2026-08-12T05:06:17.953542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.937261Z","title":"Scalable end-to-end autonomous vehicle testing via rare-event simulation","venue":null,"work_id":"0ad1cf85-36b4-4005-ab21-675e485e4dfa","year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.758392Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:bf34e8a1d58d1a4e1affb7ffd8733e77ff762757d87f62dd4ed235a492d9c177","observation_id":"fdf0f1bc-cf60-400f-95e1-1f900bd8543b","resolution":{"observed_at":"2026-08-12T05:06:17.941219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.925261Z","title":"Policy teaching via environment poisoning: Training-time adversarial attacks against reinforcement learning","venue":null,"work_id":"b3406745-aa89-4afd-b716-5a5f6013c418","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.761981Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:37667643e4d179c8800e33247c4e17f6e59db8a09d7fdc4a26b855d98feb2675","observation_id":"56475e9b-693a-456c-9ad2-867ea7de038f","resolution":{"observed_at":"2026-08-12T05:06:17.929152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08492","last_updated":"2021-02-16T23:20:15Z","snapshot_observed_at":"2026-08-16T19:12:11.702481Z","submitted_at":"2021-02-16T23:20:15Z","title":"Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08492","snapshot_observed_at":"2026-08-12T05:06:17.765785Z","title":"Reward poisoning in reinforcement learning: Attacks against unknown learners in unknown environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.765785Z"},"links":{"cited_paper":"/paper/2102.08492","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:dc0f0ef648c1d95fab9cead11cf4fb3426964ab0f4005658838d7bf3ddb1f51f","observation_id":"4cc6e3a0-a54c-4803-91a9-6ba3571ffe9e","resolution":{"observed_at":"2026-08-12T05:06:17.765785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13663","last_updated":"2022-08-29T15:10:14Z","snapshot_observed_at":"2026-08-16T19:10:43.111076Z","submitted_at":"2022-08-29T15:10:14Z","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.13663","snapshot_observed_at":"2026-08-12T05:06:17.769893Z","title":"Understanding the limits of poisoning attacks in episodic reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.769893Z"},"links":{"cited_paper":"/paper/2208.13663","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:6150dc26f0887d13ed8f04d3b0470f7723fe6bed46b4a5417bdf70abf050175d","observation_id":"97552221-9bfa-4bb2-aece-d0d53118d6b5","resolution":{"observed_at":"2026-08-12T05:06:17.769893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.913405Z","title":"Reward poisoning attacks on offline multi-agent reinforcement learning","venue":null,"work_id":"ede7bf39-2a5f-4389-91a8-7136160de6b8","year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.774031Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:712688d7f92f49ddca41addab55f0a7f8a812a2c14b5a64479ac0945c9e6b919","observation_id":"be65d024-5bbe-40a7-8513-44b8efcb0216","resolution":{"observed_at":"2026-08-12T05:06:17.917456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.901349Z","title":"Spiking pitch black: Poisoning an unknown environment to attack unknown reinforcement learners","venue":null,"work_id":"6d63bebe-4e6d-4e92-944a-79e0eac6084b","year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.777486Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:f5b0291bf3990055bdaab9113d1b45be7e23667c3a75f6029fdf15b1a2a68fef","observation_id":"d8c94cc8-9b3d-49eb-b627-4ca583954b65","resolution":{"observed_at":"2026-08-12T05:06:17.905837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10681","last_updated":"2023-05-18T03:37:29Z","snapshot_observed_at":"2026-08-16T19:11:22.070802Z","submitted_at":"2023-05-18T03:37:29Z","title":"Black-Box Targeted Reward Poisoning Attack Against Online Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10681","snapshot_observed_at":"2026-08-12T05:06:17.781396Z","title":"Black-box targeted reward poisoning attack against online deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.781396Z"},"links":{"cited_paper":"/paper/2305.10681","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:e631aef46de4c87a54f7935dff890917ead39840f3471643ce51d2dd55ee50cf","observation_id":"cb5ed119-5c80-4f61-a445-b92930e51152","resolution":{"observed_at":"2026-08-12T05:06:17.781396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.887645Z","title":"Adaptive reward-poisoning attacks against reinforcement learning","venue":null,"work_id":"915de3c9-2e37-46ab-a677-78d6d1058b58","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.785227Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:21c2dd8b4aae31f761e4726e9fee6d34df3efc5884e2ce868eef412d6bd5229b","observation_id":"54323036-961a-496b-8822-2da88b6a6027","resolution":{"observed_at":"2026-08-12T05:06:17.893439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T13:58:37.435948Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2412.00797."}