{"as_of":"2026-08-10T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68cb70252cde530f44a34dd3ca637fc66a1dbb07786687a9ab27d872aec52740","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:47.229805Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06891/citation-record","integrity":"/paper/2506.06891/integrity","json":"/paper/2506.06891/citation-record.json","paper":"/paper/2506.06891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.732334Z","title":null,"venue":null,"work_id":"a0d8948c-30be-4406-8318-70d78084956d","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.229805Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:af2ff2c19cfe6dfed8af31f7af64734b8999db199b2b3415d4cd7ac0b12ed557","observation_id":"27025b2e-4e77-40d8-91c3-85fba343b45f","resolution":{"observed_at":"2026-08-07T05:52:47.735305Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15143","last_updated":"2025-05-21T06:00:41Z","snapshot_observed_at":"2026-08-08T06:05:52.295070Z","submitted_at":"2025-05-21T06:00:41Z","title":"Filtering Learning Histories Enhances In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.15143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15143","snapshot_observed_at":"2026-08-07T05:52:47.715498Z","title":"Filtering Learning Histories Enhances In-Context Reinforcement Learning","venue":"cs.LG","work_id":"4ad771b9-41b0-4439-89b9-778c11f94864","year":2025},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.144755Z"},"links":{"cited_paper":"/paper/2505.15143","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:08ee7dbc6e5afc2c259d1966b9108ddcd2ae44908e0dd4968dbc4b7e1fbc7ba3","observation_id":"df4ff8b2-7fdb-4e63-aeb8-5e4697426ef1","resolution":{"observed_at":"2026-08-07T05:52:47.718666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.748167Z","title":"We chose the α-trimmed variant, which performs best empirically","venue":null,"work_id":"df14705e-ab63-4ad9-a197-2d6965185612","year":2020},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.224237Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:fa71f34b080be0b39941754b965820d06085ed6faccee607d405c47dfa963d5c","observation_id":"99f4c225-b51a-4a8e-ad62-0a2e1285aa00","resolution":{"observed_at":"2026-08-07T05:52:47.750820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:52:47.158998Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.158998Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:3420bdaed7feba867d4c6e9ad8ae6eab17d64012da0b2e91afb55a24cdadc34f","observation_id":"1f6ff6e3-61c7-44a2-8c64-88ae69ffeb6d","resolution":{"observed_at":"2026-08-07T05:52:47.158998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02160","last_updated":"2025-06-02T02:16:50Z","snapshot_observed_at":"2026-08-09T19:55:41.721138Z","submitted_at":"2024-02-03T14:20:20Z","title":"Data Poisoning for In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02160","snapshot_observed_at":"2026-08-07T05:52:47.165231Z","title":"Data poisoning for in-context learning.arXiv preprint arXiv:2402.02160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.165231Z"},"links":{"cited_paper":"/paper/2402.02160","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:b358e6025a82fc6d040eef6d9c1d8f1814ec69341867807ffc4a46e78936affe","observation_id":"12a8d48f-d0b8-4feb-ab1a-2cba963e91e1","resolution":{"observed_at":"2026-08-07T05:52:47.165231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03391","last_updated":"2023-03-03T14:56:36Z","snapshot_observed_at":"2026-08-08T00:49:51.026623Z","submitted_at":"2023-03-03T14:56:36Z","title":"Decision Transformer under Random Frame Dropping","version":1},"cited_work":{"arxiv_id":"2303.03391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03391","snapshot_observed_at":"2026-08-07T05:52:47.665713Z","title":"Decision Transformer under Random Frame Dropping","venue":"cs.LG","work_id":"6e323343-173e-49ed-98a2-59f6b2810b93","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.167875Z"},"links":{"cited_paper":"/paper/2303.03391","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:66058a2d317c20307cf411e3edc87e52dd37e6064c05432696bba888394b42b6","observation_id":"5d2781a7-4306-49a4-af79-d29143ccc42e","resolution":{"observed_at":"2026-08-07T05:52:47.668693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-07T05:52:47.170551Z","title":"Adversarial attacks on neural network policies.arXiv preprint arXiv:1702.02284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.170551Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:8a351c6c90b31ead41ea159e78f6f9ec8883da8bf5b48346a5c0ce174225e7e5","observation_id":"ca54a501-c1f5-4e85-8943-89d798fbda97","resolution":{"observed_at":"2026-08-07T05:52:47.170551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.788987Z","title":"Thodoris Lykouris, Vahab Mirrokni, and Renato Paes Leme","venue":null,"work_id":"3b8f8f69-f272-4b86-80a4-01b6e2d0f0de","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.180533Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:b0a27b0ec7cfec3ca571c71710004e584769ccd1cf0c45cf6c1bb6e1b74dc702","observation_id":"65ddb73e-84f5-45ce-93fe-72119da406e3","resolution":{"observed_at":"2026-08-07T05:52:47.791720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-07T05:52:47.188471Z","title":"A survey of in-context reinforcement learning.arXiv preprint arXiv:2502.07978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.188471Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:1f86781e3cc454c4e287308e31241e94be07714db8aeebdbe6085257ce6b11ae","observation_id":"1746c1c3-08e4-4fab-af78-76e71a11315e","resolution":{"observed_at":"2026-08-07T05:52:47.188471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13851","last_updated":"2023-02-27T14:52:15Z","snapshot_observed_at":"2026-08-04T17:15:04.052083Z","submitted_at":"2023-02-27T14:52:15Z","title":"Implicit Poisoning Attacks in Two-Agent Reinforcement Learning: Adversarial Policies for Training-Time Attacks","version":1},"cited_work":{"arxiv_id":"2302.13851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.13851","snapshot_observed_at":"2026-08-07T05:52:47.453690Z","title":"Implicit Poisoning Attacks in Two-Agent Reinforcement Learning: Adversarial Policies for Training-Time Attacks","venue":"cs.LG","work_id":"124f163b-e4a1-4766-b56b-d9a38f166e14","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.191020Z"},"links":{"cited_paper":"/paper/2302.13851","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:752c767ced3b874ad03d91773b4ac3549ad5ea7b5cf6dc80b18d3f62984fa1e1","observation_id":"3997a93b-b66b-40db-8f6b-7a90da0c71ba","resolution":{"observed_at":"2026-08-07T05:52:47.456709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11347","last_updated":"2019-02-27T19:23:41Z","snapshot_observed_at":"2026-08-07T15:15:34.263627Z","submitted_at":"2018-03-30T05:47:11Z","title":"Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11347","snapshot_observed_at":"2026-08-07T05:52:47.193639Z","title":"Learning to adapt in dynamic, real-world environments through meta-reinforcement learning.arXiv preprint arXiv:1803.11347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.193639Z"},"links":{"cited_paper":"/paper/1803.11347","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:6f62d8374f05fe89f55cc51ce9799c58129dc198d8bc5685ca48bedf92576a40","observation_id":"1a6ce69d-45fd-4d9f-9e92-77ff00cc3797","resolution":{"observed_at":"2026-08-07T05:52:47.193639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.772509Z","title":"Practical black-box attacks against machine learning","venue":null,"work_id":"b4211f03-ce68-4fd8-b176-81c3a100e885","year":2017},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.196137Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:6aca4d4c1597aeec79c612c976dda577dddc0b9e63644021347a067f7b91f95e","observation_id":"e1883a44-6921-4c55-96f1-c3ca9f319d51","resolution":{"observed_at":"2026-08-07T05:52:47.775957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13663","last_updated":"2022-08-29T15:10:14Z","snapshot_observed_at":"2026-08-10T11:00:18.694777Z","submitted_at":"2022-08-29T15:10:14Z","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.13663","snapshot_observed_at":"2026-08-07T05:52:47.198902Z","title":"Understanding the limits of poisoning attacks in episodic reinforcement learning.arXiv preprint arXiv:2208.13663,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.198902Z"},"links":{"cited_paper":"/paper/2208.13663","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:0ba7096c3c894ea62a764c6ada4b96da835e6c8273c41ec8be988e57c804022e","observation_id":"51b86397-76fc-4f7f-ac2f-48a0ea11e66f","resolution":{"observed_at":"2026-08-07T05:52:47.198902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i04.6047","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"URLhttps://ojs.aaai.org/index.php/AAAI/article/view/6047","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"f8b8082d-2962-4d7b-8bba-811968672765","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.201561Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:2625ea42d86215ee94e89447f57ff1d382a834b2af902a28f59ab9fd491b9bac","observation_id":"7e0fc685-3e21-458d-a5f1-e300e5ef0ef7","resolution":{"observed_at":"2026-08-07T05:52:47.268078Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.764064Z","title":"Christopher JCH Watkins and Peter Dayan","venue":null,"work_id":"f8e78acf-a9ba-429c-b976-95d92238e2a7","year":2017},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.209368Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:eff3703b039a963f73bbc0b89a71d0bd8cb3a61dd84ad2d33092cb8ba0edd224","observation_id":"f136a351-c851-4d85-97ec-01aa741e0cc0","resolution":{"observed_at":"2026-08-07T05:52:47.766759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i14.29529","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"URL https://ojs.aaai","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"ef78e1e0-4c33-4310-ab31-32d247d8f5a6","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.211768Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:7033e3262211496a2de3b8f41062d2c48e005dd0b638e86b7ed53a670d702a6a","observation_id":"e49cd421-c9de-4350-85c8-d7651e67ca60","resolution":{"observed_at":"2026-08-07T05:52:47.258152Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19705","last_updated":"2024-10-25T17:27:58Z","snapshot_observed_at":"2026-07-31T06:15:34.869052Z","submitted_at":"2024-10-25T17:27:58Z","title":"Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks","version":1},"cited_work":{"arxiv_id":"2410.19705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19705","snapshot_observed_at":"2026-08-07T05:52:47.293053Z","title":"Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks","venue":"cs.LG","work_id":"54cae0b4-14c4-4691-bab1-6f4df724e6a7","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.214169Z"},"links":{"cited_paper":"/paper/2410.19705","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:2d583c450897fc89df276e7387db53ba64061a222f77b8a33251ba1df9381a9d","observation_id":"28009646-614a-4c3d-b7a0-c37f2050d375","resolution":{"observed_at":"2026-08-07T05:52:47.296109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12955","last_updated":"2024-03-09T17:46:44Z","snapshot_observed_at":"2026-08-10T06:32:26.653910Z","submitted_at":"2023-10-19T17:54:39Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12955","snapshot_observed_at":"2026-08-07T05:52:47.216750Z","title":"Towards robust offline reinforcement learning under diverse data corruption.arXiv preprint arXiv:2310.12955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.216750Z"},"links":{"cited_paper":"/paper/2310.12955","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:ebccfded65bc90db3d5238a0587417c74ae30f69d51db61a31e1e6f6defe56bb","observation_id":"fe2de193-e9e5-4310-9462-b571e2eb62ef","resolution":{"observed_at":"2026-08-07T05:52:47.216750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05949","last_updated":"2024-10-09T11:46:24Z","snapshot_observed_at":"2026-07-06T17:14:19.624035Z","submitted_at":"2024-01-11T14:38:19Z","title":"Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05949","snapshot_observed_at":"2026-08-07T05:52:47.219188Z","title":"Universal vulnerabilities in large language models: In-context learning backdoor attacks.arXiv preprint arXiv:2401.05949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.219188Z"},"links":{"cited_paper":"/paper/2401.05949","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:3a7c2f5c1efef4a1181b52d2354fee857f77217b414f0b3be17c25c3ac10cbec","observation_id":"e5d1c826-323a-4a57-b213-bcdb645d0471","resolution":{"observed_at":"2026-08-07T05:52:47.219188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.756282Z","title":"17 A.2 crUCB","venue":null,"work_id":"30786fa8-099c-41ed-83f5-568835602899","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.221741Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:a111d1171fd1a6e8376ebbcea0ecf9c1ccb5a8daa05a70e67593171f073dc475","observation_id":"892269cb-bfc4-41fc-8ca9-6c840a8957cf","resolution":{"observed_at":"2026-08-07T05:52:47.758795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.740531Z","title":"A.3 CRLINUCB We source the CRLinUCB algorithm from Ding et al","venue":null,"work_id":"496b1bbb-94d0-476f-8bcc-071e7bded273","year":2022},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.227370Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:06986fc1578dbfc2f8fae094152fe081ae6f9ce7282244e95b382f7da002f9ff","observation_id":"2d271eeb-7d20-4bda-8555-70f2b8f207c6","resolution":{"observed_at":"2026-08-07T05:52:47.743153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.206980Z","title":"URL http://www.jstor.org/stable/2332286","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":1933,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.206980Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:8b2c5c594b7f88e4043d1ff470e31bfba9b3c1025d0175d4c3827ab4b7d22866","observation_id":"2687ddba-a36d-4d36-ac32-b92a22a65b81","resolution":{"observed_at":"2026-08-07T05:52:47.206980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.173278Z","title":"URL https://doi.org/10.1214/ aoms/1177703732","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":1964,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.173278Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:008cbd3fae52dd6cc8bc443a54d1de42a82442cb80d1b72af08d1e10c0a05de5","observation_id":"fa42f0e6-444b-44d2-80b2-e2ce2d03bcbe","resolution":{"observed_at":"2026-08-07T05:52:47.173278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-08T00:48:37.690583Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-07T05:52:47.175619Z","title":"Michael Laskin, Luyu Wang, Junhyuk Oh, Emilio Parisotto, Stephen Spencer, Richie Steigerwald, DJ Strouse, Steven Hansen, Angelos Filos, Ethan Brooks, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.175619Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:c7fb59b9fdb1a34a62825ec880dce59d71015321f4dab38a5a3864fe319abf2c","observation_id":"a0692b87-26f3-4328-a687-d52ad9c61d5a","resolution":{"observed_at":"2026-08-07T05:52:47.175619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-10T08:00:33.857715Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-07T05:52:47.134864Z","title":"doi: 10.1023/A: 1013689704352","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.134864Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:f63c73d0839ce83203cd67a5f8319ef192d41f671b5bb3f6748b8c8838ee1d7a","observation_id":"60c842f6-b19c-4219-8770-a2d2879e6b58","resolution":{"observed_at":"2026-08-07T05:52:47.134864Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.178059Z","title":"ISBN 9781605587998","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.178059Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:6a28d06998e8145ce9ed18c03711a160661df31069179e7fb3d6cbd82fca63f7","observation_id":"0df5aec3-4b63-4980-bee9-bf6e870e2ec2","resolution":{"observed_at":"2026-08-07T05:52:47.178059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.06733","last_updated":"2019-03-11T20:45:33Z","snapshot_observed_at":"2026-07-06T05:56:16.413472Z","submitted_at":"2017-08-22T17:31:54Z","title":"BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.06733","snapshot_observed_at":"2026-08-07T05:52:47.161755Z","title":"Badnets: Identifying vulnerabilities in the machine learning model supply chain.arXiv preprint arXiv:1708.06733,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.161755Z"},"links":{"cited_paper":"/paper/1708.06733","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:b2c1fede35248f4e0da0c7970accb870e84a7be0a4565d6d9b78923230267ed1","observation_id":"54ab52f4-e511-484c-b98f-671b9e56d912","resolution":{"observed_at":"2026-08-07T05:52:47.161755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.804893Z","title":"Improved corruption robust algorithms for episodic reinforcement learning","venue":null,"work_id":"442c88ca-9ce5-470d-a54d-2c201103ab08","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.150844Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:7a85718acc1409e1412decff75805c7863cefbb2def66398aa0176974545d8c0","observation_id":"b52de5ab-0527-471e-9505-869efaeb9556","resolution":{"observed_at":"2026-08-07T05:52:47.807523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.183209Z","title":"ISBN 9781450355599","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.183209Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:0c444d56e96a70b59769190abaa82c4b60d32f92768a531400434c44edc0f0f0","observation_id":"786c1c23-1392-4f09-99dd-e3e8f2b540e6","resolution":{"observed_at":"2026-08-07T05:52:47.183209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.781267Z","title":"Shike Mei and Xiaojin Zhu","venue":null,"work_id":"ee943f67-b136-41fd-a77b-053a31ec8c70","year":2019},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.185916Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:39ea5d53b66d4fe0da6d78ece515f734d5a17307c2af8110f80576996dd22630","observation_id":"41d83310-d62f-46ec-8bfd-c2e59c2c330e","resolution":{"observed_at":"2026-08-07T05:52:47.783983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.142043Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.142043Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:607d1b1e9e98de75cbd988c246c1d1890eab711807df7ff6c7d1bd9cb8120577","observation_id":"19a3987a-b618-4194-8dd8-91f026d85e9c","resolution":{"observed_at":"2026-08-07T05:52:47.142043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-07T05:52:47.204252Z","title":"Intriguing properties of neural networks.arXiv preprint arXiv:1312.6199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.204252Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:749bcb45a5b2a24aa8747e346abd2083226b99e91e6953b4eb4cdc178b2aaef2","observation_id":"66563669-82bd-45bf-8186-546ab5f6f483","resolution":{"observed_at":"2026-08-07T05:52:47.204252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.797133Z","title":"Juncheng Dong, Moyang Guo, Ethan X Fang, Zhuoran Yang, and Vahid Tarokh","venue":null,"work_id":"460c682b-c92f-459c-a708-0b31219f349a","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.153537Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:9fd1d1de2e4f15e441aec8680446bd8378decf9ba12df2bac5fbaf8d01a0112e","observation_id":"f273fc84-7c3c-4e86-8f73-f360b450647c","resolution":{"observed_at":"2026-08-07T05:52:47.799877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.818117Z","title":"Evasion attacks against machine learning at test time","venue":null,"work_id":"0ece1ba7-1381-4ea8-8809-ffb1c71d4907","year":2013},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.138951Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:9a0b538b0706e184516a1849184b34a5cf95133f19f3849b57a9d5872e5e78b6","observation_id":"b66940f3-31ae-45c0-951c-119617dbbb3e","resolution":{"observed_at":"2026-08-07T05:52:47.820843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-07T05:52:47.156119Z","title":"RL2: Fast reinforcement learning via slow reinforcement learning.arXiv preprint arXiv:1611.02779,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.156119Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:ebfecd524244a1a08a0a0a1fbc5390b389ba33e0ecc01d0c163e448703e58418","observation_id":"ec03edf5-12fe-4e40-bbcc-cbc5698483f0","resolution":{"observed_at":"2026-08-07T05:52:47.156119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05526","last_updated":"2017-12-15T04:26:26Z","snapshot_observed_at":"2026-07-06T06:14:30.795326Z","submitted_at":"2017-12-15T04:26:26Z","title":"Targeted Backdoor Attacks on Deep Learning Systems Using Data Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05526","snapshot_observed_at":"2026-08-07T05:52:47.147789Z","title":"Targeted backdoor attacks on deep learning systems using data poisoning.arXiv preprint arXiv:1712.05526,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.147789Z"},"links":{"cited_paper":"/paper/1712.05526","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:9287c8504cd650080024f225a26b845e53d1d20a08652b7f96a104bb667401a0","observation_id":"30bce87b-27c9-463b-937a-9e95f4799bbd","resolution":{"observed_at":"2026-08-07T05:52:47.147789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.06891."}