{"as_of":"2026-08-11T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82b38d1a14cadc176272ab5b905b979cd60d1f695dc8d226f676ee98986f5e84","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:03.780401Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:12:22.885999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T00:31:24.539214Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-06T19:12:22.885999Z","title":"Security concerns for large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06323","last_updated":"2025-07-08T18:24:28Z","snapshot_observed_at":"2026-08-06T19:05:12.143746Z","submitted_at":"2025-07-08T18:24:28Z","title":"Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:12:22.885999Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2507.06323"},"observation_digest":"sha256:612c52b9c2e1e69d13387d419c18863ee1f637c32b64ea915e081c373ca6d264","observation_id":"2ee4e6f2-7cd7-497b-b623-98bf6ffa8b58","resolution":{"observed_at":"2026-08-06T19:12:22.885999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2505.18889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security Concerns for Large Language Models: A Survey","venue":null,"work_id":"998c55c6-39ca-4bf1-9129-52de8b1455d4","year":2025},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-17T00:29:07.951709Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:6fb72e671ca57cdd1825839ee1b5cf3c5f15044b36805c5e7518059baba15313","observation_id":"b093e5c6-e241-448f-98f4-13db15d84283","resolution":{"observed_at":"2026-05-17T00:31:24.541239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-03T18:19:22.067036Z","title":"Security Concerns for Large Language Models: A Survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":4},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-03T18:19:22.067036Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:0ef3aa928dcd9e4bc7a4ba364c80a4187506717147e891cd03bc96b30df71d32","observation_id":"a210001a-a16e-4ba2-9984-e67cd692f373","resolution":{"observed_at":"2026-08-03T18:19:22.067036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-03T09:53:25.123806Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12359","last_updated":"2026-01-18T11:33:35Z","snapshot_observed_at":"2026-08-06T10:38:00.882004Z","submitted_at":"2026-01-18T11:33:35Z","title":"Zero-Shot Embedding Drift Detection: A Lightweight Defense Against Prompt Injections in LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:25.123806Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2601.12359"},"observation_digest":"sha256:22f6a638084f74fc9ea6e5b333caaaed7a22cf731f24de23ad55600a518bad7b","observation_id":"7698991f-040b-4cc0-affd-9512d14552e9","resolution":{"observed_at":"2026-08-03T09:53:25.123806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-02T21:46:33.293428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19218","last_updated":"2026-06-09T15:02:00Z","snapshot_observed_at":"2026-08-05T17:29:43.215311Z","submitted_at":"2026-02-22T15:02:00Z","title":"Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:33.293428Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2602.19218"},"observation_digest":"sha256:aad7e2fd5d1627128d5fc3a27080a9d72052afa60db4c82056e62fcf20573825","observation_id":"89b8a45c-01e6-42eb-8b6f-309f69ae204e","resolution":{"observed_at":"2026-08-02T21:46:33.293428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2505.18889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security Concerns for Large Language Models: A Survey","venue":null,"work_id":"998c55c6-39ca-4bf1-9129-52de8b1455d4","year":2025},"citing_paper":{"arxiv_id":"2604.18803","last_updated":"2026-04-25T21:48:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T20:21:27Z","title":"LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:01.039309Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2604.18803"},"observation_digest":"sha256:c1b36fb2b5acd36294a0c6457a76d240e25dabd71fefc4b2db451c6d37537f68","observation_id":"a4ecefb4-f0f3-44a9-a41d-79f573a1a009","resolution":{"observed_at":"2026-05-10T09:38:43.149038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-02T05:10:09.315243Z","title":"Li and Benjamin C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13453","last_updated":"2026-07-15T05:26:43Z","snapshot_observed_at":"2026-08-10T19:59:55.108735Z","submitted_at":"2026-07-15T05:26:43Z","title":"Adversarial Prompting Framework for AI Safety Assessment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:10:09.315243Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2607.13453"},"observation_digest":"sha256:1e45b127d10fb365702f21896d423f5c5366536406d951c088d9fc162de4d857","observation_id":"f11db4e2-a816-4d47-aad9-ec665cf4ea53","resolution":{"observed_at":"2026-08-02T05:10:09.315243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18889/citation-record","integrity":"/paper/2505.18889/integrity","json":"/paper/2505.18889/citation-record.json","paper":"/paper/2505.18889"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T14:27:03.364590Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.364590Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8e86106076af06aa012a538b0d16e20fefbc6a18a2594316b443ab91c3bb4bcc","observation_id":"1b66ac07-a466-4c8b-9424-707bdcc9a53e","resolution":{"observed_at":"2026-08-07T14:27:03.364590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.370897Z","title":"System Card: Claude Opus 4 & Claude Sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.370897Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8e2e283afc065d9e085ba17ef233b2eebf60c41d212f9e27371b3b25990036aa","observation_id":"40fc1189-3a08-465a-b301-751bdf4b694b","resolution":{"observed_at":"2026-08-07T14:27:03.370897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.376217Z","title":"Theclaude3modelfamily:Opus,sonnet,haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.376217Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:bb38e515f9181fcbba7b29e6e937b53089ec61aba286f9f5fed8251551d9b095","observation_id":"a406cd1d-1821-4e37-b4ca-a6701e8d1913","resolution":{"observed_at":"2026-08-07T14:27:03.376217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.381548Z","title":"Embedding-based classifiers can detect prompt injection attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.381548Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0d9a2144433f730c433ca8718415008ecdaf2b948e80522bd035d676361f5c28","observation_id":"317e49e5-374c-40d5-8786-b7729eb72d50","resolution":{"observed_at":"2026-08-07T14:27:03.381548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-07T14:27:03.386052Z","title":"Monitoring reasoning modelsformisbehaviorandtherisksofpromotingobfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.386052Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e506e54ebb92cdcafbb51d40dfef2c8664e34dec90fd5da85cffd6cf7ccc36cc","observation_id":"97ce77fa-9edb-42ac-a154-3bd1a17c4167","resolution":{"observed_at":"2026-08-07T14:27:03.386052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16513","last_updated":"2025-01-30T08:00:14Z","snapshot_observed_at":"2026-08-10T21:30:49.585704Z","submitted_at":"2025-01-27T21:26:37Z","title":"Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16513","snapshot_observed_at":"2026-08-07T14:27:03.390674Z","title":"Deception in llms: Self- preservation and autonomous goals in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.390674Z"},"links":{"cited_paper":"/paper/2501.16513","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:4801cabfcc80f762adc744ecc46ae6ad13b5bcba2e5309b39aa5bcaa2f1d36c2","observation_id":"466f5ac9-9c5a-48fe-80b1-f32da3f1006f","resolution":{"observed_at":"2026-08-07T14:27:03.390674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05232","last_updated":"2025-07-03T18:06:35Z","snapshot_observed_at":"2026-08-10T10:31:44.623753Z","submitted_at":"2024-12-06T18:02:59Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","version":3},"cited_work":{"arxiv_id":"2412.05232","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05232","snapshot_observed_at":"2026-08-07T14:27:04.860102Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","venue":"cs.CL","work_id":"65cdd210-a0dd-4fab-803c-d66244c4848e","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.396465Z"},"links":{"cited_paper":"/paper/2412.05232","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:4200d9b7d0019575072c16b3a14a604224f120adeb414346c487a6e98e2b916b","observation_id":"08abe4a7-9e46-4070-a905-96ca93301b08","resolution":{"observed_at":"2026-08-07T14:27:04.889778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15657","last_updated":"2025-02-24T18:14:15Z","snapshot_observed_at":"2026-08-08T14:17:37.842596Z","submitted_at":"2025-02-21T18:28:36Z","title":"Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15657","snapshot_observed_at":"2026-08-07T14:27:03.401477Z","title":"Superintelligent agents pose catastrophic risks: Can scientist ai offer a safer path? arXiv preprint arXiv:2502.15657","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.401477Z"},"links":{"cited_paper":"/paper/2502.15657","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1b3e7e6f82397a4b50bb2956961c64f55830b69f61aee37cc57c3ef3dc2959d1","observation_id":"554e00f1-c718-43d1-882c-12be9106f299","resolution":{"observed_at":"2026-08-07T14:27:03.401477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-11T11:06:30.148202Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:27:03.407254Z","title":"Red-teaming large language mod- els using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.407254Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:96cc7f38dc89e6f90823c9bdebd17e0326d060cb9b147804e5692336d2fb739b","observation_id":"cf7d8278-25e5-430d-8210-761a9ce1c0b0","resolution":{"observed_at":"2026-08-07T14:27:03.407254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.412812Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.412812Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c2bd97d1566115c2d4bfc876b3bbed2bdc2cf79cc47059aadbdb9f6bd0fab7ab","observation_id":"3852f90b-0c1a-4b47-bc46-85e3acf1666e","resolution":{"observed_at":"2026-08-07T14:27:03.412812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:27:03.417247Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.417247Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9852a467608a7e151976e4bd7d058cae32d6c22e7abf4478b29e4af4a8b15b23","observation_id":"99ec921e-878c-44c2-9900-bfff5d05ad88","resolution":{"observed_at":"2026-08-07T14:27:03.417247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10414","last_updated":"2024-11-15T18:34:07Z","snapshot_observed_at":"2026-08-06T19:21:24.933454Z","submitted_at":"2024-11-15T18:34:07Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10414","snapshot_observed_at":"2026-08-07T14:27:03.421477Z","title":"Llama guard 3vision:Safeguardinghuman-aiimageunderstandingconversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.421477Z"},"links":{"cited_paper":"/paper/2411.10414","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:fd3b7094b3f88c67f092de0433876301566a9ea088ae96252b3e0d1589c8a9d6","observation_id":"48eb96e2-9bbc-4668-9c72-6313023d7d9b","resolution":{"observed_at":"2026-08-07T14:27:03.421477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02817","last_updated":"2025-01-30T11:11:37Z","snapshot_observed_at":"2026-08-07T20:57:52.378876Z","submitted_at":"2024-03-05T09:37:13Z","title":"Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02817","snapshot_observed_at":"2026-08-07T14:27:03.426864Z","title":"Here comes the ai worm: Unleashing zero-click worms that target genai-powered applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.426864Z"},"links":{"cited_paper":"/paper/2403.02817","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:38293659c76a2e0433dc9b9ad9d5e38248ed1f571aadc498887afe748f082e8b","observation_id":"95ad58b2-1d5a-4c5a-8193-bf587a9eb541","resolution":{"observed_at":"2026-08-07T14:27:03.426864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08535","last_updated":"2024-01-24T06:07:20Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:24:15Z","title":"Formally Specifying the High-Level Behavior of LLM-Based Agents","version":3},"cited_work":{"arxiv_id":"2310.08535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08535","snapshot_observed_at":"2026-08-07T14:27:04.748972Z","title":"Formally Specifying the High-Level Behavior of LLM-Based Agents","venue":"cs.AI","work_id":"a8007a5e-be90-420b-9458-403e8bb7a885","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.431586Z"},"links":{"cited_paper":"/paper/2310.08535","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:a6f86312e40426cbbaa4141d99cecd15279607fdf9adcf4c0c603db920bcecc1","observation_id":"50b95a10-6167-4fa7-89c3-058e2b64e073","resolution":{"observed_at":"2026-08-07T14:27:04.757335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.788194Z","title":null,"venue":null,"work_id":"8c42345f-1aad-4945-9b98-922cd4b7050d","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.436483Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:86e41f91dbadaef3798b740ba3caef89d83150b79a0ab206d133f7eff3c2faa7","observation_id":"1762adc4-8824-456b-b369-5d8da4c9c261","resolution":{"observed_at":"2026-08-07T14:27:08.854007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.618341Z","title":"Security and privacy chal- lengesoflargelanguagemodels:Asurvey","venue":null,"work_id":"d8157b49-37b2-4a9a-9529-9e8fe657e3b0","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.445557Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:cfa6f4a5264d78a2b6d79c2620b9e45ea2b2d74ca430d64a594b11c245017b6b","observation_id":"7e49c603-d220-482d-b4be-a746810aba26","resolution":{"observed_at":"2026-08-07T14:27:08.696535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17614","last_updated":"2024-12-23T14:36:37Z","snapshot_observed_at":"2026-08-11T05:19:05.970349Z","submitted_at":"2024-12-23T14:36:37Z","title":"Emerging Security Challenges of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17614","snapshot_observed_at":"2026-08-07T14:27:03.449834Z","title":"Emerging security challenges of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.449834Z"},"links":{"cited_paper":"/paper/2412.17614","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:238f1f30b64e7d117cfdc56db6b8ec77ea341fd1c162da9e2d2d056d9502ad6a","observation_id":"4b6a04d7-0ff7-43f8-9b06-3d0a76b46036","resolution":{"observed_at":"2026-08-07T14:27:03.449834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00374","last_updated":"2024-09-11T12:48:42Z","snapshot_observed_at":"2026-07-06T16:55:29.501535Z","submitted_at":"2023-12-01T06:36:17Z","title":"The Philosopher's Stone: Trojaning Plugins of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00374","snapshot_observed_at":"2026-08-07T14:27:03.455337Z","title":"The philosopher’s stone: Trojaning plugins of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.455337Z"},"links":{"cited_paper":"/paper/2312.00374","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c716077d4caf3dde5ab495e28f97e0d0b941787899b2db22b415bcd699903437","observation_id":"1a31531c-5d8d-4bc5-8768-c8c5491ee37c","resolution":{"observed_at":"2026-08-07T14:27:03.455337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09841","last_updated":"2025-04-14T03:22:04Z","snapshot_observed_at":"2026-08-10T20:55:59.514257Z","submitted_at":"2025-04-14T03:22:04Z","title":"StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.09841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09841","snapshot_observed_at":"2026-08-07T14:27:04.666574Z","title":"StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models","venue":"cs.CR","work_id":"b818a7a4-20d5-4495-bd71-905a90fb2776","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.459930Z"},"links":{"cited_paper":"/paper/2504.09841","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:a4eb506a317c5b5301cb2f5e6a4a498970543908aeecd1006d505d884fc38063","observation_id":"bb2fdb16-1cda-447a-87f1-5527d52d15b9","resolution":{"observed_at":"2026-08-07T14:27:04.677664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02174","last_updated":"2025-06-05T21:52:43Z","snapshot_observed_at":"2026-08-07T23:28:57.444046Z","submitted_at":"2025-03-04T01:31:17Z","title":"Adversarial Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02174","snapshot_observed_at":"2026-08-07T14:27:03.464470Z","title":"Adversarial tokenization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.464470Z"},"links":{"cited_paper":"/paper/2503.02174","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3aac71f0c4bd183efff0640eb13239adc5590128c44a124a785787c2c98fc508","observation_id":"d82fce64-904b-421d-9092-11a1acc7c9e9","resolution":{"observed_at":"2026-08-07T14:27:03.464470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.439912Z","title":null,"venue":null,"work_id":"3579a87b-4147-42b9-bd90-8f9d074a0cc0","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.469121Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:12a63cb35126eca102c7882ea6e3b4c5297bad846fdb31a92220091e8e99948f","observation_id":"20143416-9609-4ad7-9888-37115c98b2cd","resolution":{"observed_at":"2026-08-07T14:27:08.528535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-11T10:38:35.302365Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:27:03.474448Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.474448Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c6df28589b308810009dd25a4a734079ffe95043df52932937fbc856a4d1e44a","observation_id":"428190b1-bbfa-4d5d-bc45-1d9bbdbd8c59","resolution":{"observed_at":"2026-08-07T14:27:03.474448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.480328Z","title":"System prompt poisoning: Persistent attacks on large language models beyond user injection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.480328Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e181841fcf0fa6f92572e51fad3e8373dd414f627629c17c2593e93f901b3cbb","observation_id":"62e05885-63d8-47b6-b4a4-1f4c924b55e6","resolution":{"observed_at":"2026-08-07T14:27:03.480328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14847","last_updated":"2025-06-02T01:51:09Z","snapshot_observed_at":"2026-08-07T18:01:00.658329Z","submitted_at":"2025-02-20T18:55:39Z","title":"Red-Teaming LLM Multi-Agent Systems via Communication Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14847","snapshot_observed_at":"2026-08-07T14:27:03.485673Z","title":"Red-teaming llm multi-agent systems via communication attacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.485673Z"},"links":{"cited_paper":"/paper/2502.14847","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c8f455cd7185a8af47657e470dd5bc9be8d79b34118f44ce3f9815e13337add7","observation_id":"c592c1ef-f1f2-4a3f-a571-497ca4cfcd5f","resolution":{"observed_at":"2026-08-07T14:27:03.485673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.251365Z","title":null,"venue":null,"work_id":"bc05b286-e621-4dfb-858f-ad152657eecf","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.490803Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8cd21516871b7f66cfc13677a04d949f4ccb260d747a23729c1c84a481b3e371","observation_id":"8f70f9be-cdb5-4ff8-8fe7-82d885618a5c","resolution":{"observed_at":"2026-08-07T14:27:08.359894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.063669Z","title":"Pleak: Promptleakingattacksagainstlargelanguagemodelapplications,in: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, pp","venue":null,"work_id":"d516c85a-13d3-4dd5-91b7-77e8fcba671b","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.501273Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0c85d7044e5731bfa96f4bb7eac592d622577e70638356e014f3f6eb38ee3be3","observation_id":"5d5d53c0-54d1-46bf-a773-794ecbf44098","resolution":{"observed_at":"2026-08-07T14:27:08.140247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.911540Z","title":"Poisongpt:Howwehidalobotomized llmonhuggingfacetospreadfakenews","venue":null,"work_id":"e91a7651-9be4-4b48-a960-c6b51ef2c743","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.505534Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:44c9ed4f55f286b7fea4c9061fbc40b2c611341721488232f42207f903f95528","observation_id":"c19edb68-7eff-4127-a61e-c8bac5e6f212","resolution":{"observed_at":"2026-08-07T14:27:07.995449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T14:27:03.510563Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.510563Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:23c3a6d0941b080254e49beb6c7973f26a91831e66e6dedcc5aa5c2d8a5ce408","observation_id":"a94f58ae-8610-4a7f-b05b-0dd5f644d0a1","resolution":{"observed_at":"2026-08-07T14:27:03.510563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.715464Z","title":"Llmsecurity101:Defendingagainstprompthacks","venue":null,"work_id":"88f89da6-51cb-40e2-8a97-6813c497f952","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.516147Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:20b3295f6f9bfff78d3791116139dff51f9f71506062eecd79e54dcfaead21ad","observation_id":"98d8d85c-1ef6-47f4-a1d3-809687dc6d90","resolution":{"observed_at":"2026-08-07T14:27:07.795090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-07T14:27:03.520629Z","title":"Baseline defenses for adversarial attacks against aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.520629Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:738bc8f5b5a80e37f1516766501824193affba1c43d725f2a1067cf0cba52a37","observation_id":"f1994eb4-52c4-481a-beca-94f65dd64760","resolution":{"observed_at":"2026-08-07T14:27:03.520629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.507557Z","title":"A watermark for large language models, in: International Conference on Machine Learning, PMLR","venue":null,"work_id":"59f67577-2781-4622-b1f3-344901c814f7","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.526345Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:172128a4c186efcf10506b44e328a5a7f853e9628d59fe46a86bcf876ce8bf64","observation_id":"8f5ae23f-3b17-494b-8494-438332375b7b","resolution":{"observed_at":"2026-08-07T14:27:07.598434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09798","last_updated":"2025-05-10T02:36:13Z","snapshot_observed_at":"2026-08-10T21:58:42.525514Z","submitted_at":"2025-01-16T19:01:25Z","title":"Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09798","snapshot_observed_at":"2026-08-07T14:27:03.532090Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.532090Z"},"links":{"cited_paper":"/paper/2501.09798","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:53a3816a19f579a308250fc843fc64d53283b9ad2a6303f7f11daab90a61671a","observation_id":"30fba0b6-0662-48c2-9a97-08c7f135c1c9","resolution":{"observed_at":"2026-08-07T14:27:03.532090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.260255Z","title":null,"venue":null,"work_id":"594dac3e-bff0-4057-b9d0-76f43e365a33","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.536591Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:f76dd0cebcbd3bd843f93c53c63beb6c7ba37105185a6fe1316d997f016eb234","observation_id":"d70dfd76-74a7-481c-9dd7-3d4d073c52c1","resolution":{"observed_at":"2026-08-07T14:27:07.356304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21038","last_updated":"2025-08-25T20:17:00Z","snapshot_observed_at":"2026-08-07T15:58:41.909304Z","submitted_at":"2025-04-28T07:38:43Z","title":"Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21038","snapshot_observed_at":"2026-08-07T14:27:03.546803Z","title":"Prefill-basedjailbreak:Anovelapproach of bypassing llm safety boundary","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.546803Z"},"links":{"cited_paper":"/paper/2504.21038","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:38c9b395c4a31ebed21795faf243ed2d9ddd1f70aacbccc404b9a796a97b12c2","observation_id":"1c6d1c47-9a87-431d-b297-a701ad27e765","resolution":{"observed_at":"2026-08-07T14:27:03.546803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.117379Z","title":"Backdoorllm: A comprehensive benchmark for backdoor attacks on large language models","venue":null,"work_id":"4c008346-4c21-4942-b5a9-45a77e9cdd05","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.551855Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e84dccb3668fd58acda69388325005cd7b7b526073405d6f7b694fe699c62f63","observation_id":"72ec2fdd-26f8-470c-944b-1b448705f2fb","resolution":{"observed_at":"2026-08-07T14:27:07.201977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T14:27:03.541783Z","title":"arXiv preprint arXiv:2307.13702","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.541783Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0ce7cdfa296548cddb8be59f7605f87795a5bdd19228243994def851892af6c4","observation_id":"8abbee08-07ad-450d-a4eb-89465f60a515","resolution":{"observed_at":"2026-08-07T14:27:03.541783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.671974Z","title":"Autohijacker: Automatic indirect prompt injection against black-box llm agents, in: Submitted to ICLR 2025.https://openreview.net/forum?id=11629","venue":null,"work_id":"032ae1de-f37a-4ad5-bb85-c6508a02bda8","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.561299Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9ed8feb3b45aa26207a36770d3301b5fa0a0928ce29b981e9fd91049c5fa41cb","observation_id":"663ca6f8-5b6e-4dd9-92f1-0f8e03ee9663","resolution":{"observed_at":"2026-08-07T14:27:06.805257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-07T14:27:03.566012Z","title":"Fli- pattack:Jailbreakllmsviaflipping","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.566012Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:5a545a5b986ce8bceab33fe74a248deebee8ab1347ae0af6e80da1f9ad5158d2","observation_id":"2224e001-e7fb-46b9-9f51-819fc26db4d9","resolution":{"observed_at":"2026-08-07T14:27:03.566012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.925718Z","title":"Nature Machine Intelligence , 1–14","venue":null,"work_id":"5de0975d-6750-4a67-95d1-fe244e6f9b03","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.556830Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:a8bca1c9d5509c8e1b1f190fb604f23e3885c6bc3eaac8efcceea1281cfaac2f","observation_id":"804323e0-a0cf-48dc-8476-d5e75e7d5b45","resolution":{"observed_at":"2026-08-07T14:27:07.009172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.267165Z","title":"Agentic misalign- ment: How llms could be an insider threat","venue":null,"work_id":"f4ecd0d6-977c-435d-abf0-c3424eaee660","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.576065Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9f9abbfc5515ea9b680e2a38d20d07bf8350726f91224532d6bb5f90e460889d","observation_id":"61c3d0a4-f14d-4110-a060-48a4c97eaa41","resolution":{"observed_at":"2026-08-07T14:27:06.363703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.096128Z","title":"Tree of attacks: Jailbreaking black- box llms automatically","venue":null,"work_id":"5c80c443-f485-41b2-a05e-14ff5a8d2145","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.581387Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d90c021bd8583fafe2d2bc5f0f4f84820ce916383e1c4cec94ae54e437501785","observation_id":"e8d594a7-3a99-4da9-bf24-488c8974f8f0","resolution":{"observed_at":"2026-08-07T14:27:06.153119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.474878Z","title":"Formalizing and benchmarking prompt injection attacks and defenses, in: 33rd USENIX Security Symposium (USENIX Security 24), pp","venue":null,"work_id":"19971cfb-6081-4616-91f5-2f55b2f5827d","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.570611Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:4ea0835ffc72ebd17dba61b3b7bfa6f8d6a0b6bd256fb6c24b6c7a429a02c732","observation_id":"594998f1-24d2-4b97-9986-48c367269cce","resolution":{"observed_at":"2026-08-07T14:27:06.572898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.591089Z","title":"Fully autonomous ai agents should not be developed","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.591089Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:f4fdd33c218caa616d0500fcade2b0d6e42e0e1b7add65bcc655999406cd6379","observation_id":"76516eb3-79fb-4df2-8745-0a325c84f7ea","resolution":{"observed_at":"2026-08-07T14:27:03.591089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04018","last_updated":"2026-06-22T12:47:48Z","snapshot_observed_at":"2026-08-09T08:53:39.548570Z","submitted_at":"2025-06-04T14:46:47Z","title":"AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04018","snapshot_observed_at":"2026-08-07T14:27:03.596762Z","title":"Agentmisalignment: Measuring the propen- sity for misaligned behaviour in llm-based agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.596762Z"},"links":{"cited_paper":"/paper/2506.04018","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:95b33deff980fedc14e5bcd583ca9797873b8d37096d6001cebc05666e29c45f","observation_id":"944c7bf4-9622-499a-8461-ec9b37e178a4","resolution":{"observed_at":"2026-08-07T14:27:03.596762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-09T13:05:34.738390Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T14:27:03.586403Z","title":"Frontier models are capable of in-context scheming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.586403Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0cb8a2970cda0f7ecaa2acf2e68a0ef66dad790f11c3ce4311bf4d8af8368b3d","observation_id":"af322d9b-6b9f-42ed-b73c-75edf804a0ce","resolution":{"observed_at":"2026-08-07T14:27:03.586403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04196","last_updated":"2025-08-06T08:25:40Z","snapshot_observed_at":"2026-08-06T00:50:46.772389Z","submitted_at":"2025-08-06T08:25:40Z","title":"Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.04196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04196","snapshot_observed_at":"2026-08-07T14:27:04.306133Z","title":"Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models","venue":"cs.CL","work_id":"be9718a2-4ffc-4414-b34b-30ff9f2ba6c5","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.607771Z"},"links":{"cited_paper":"/paper/2508.04196","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:67e30ef4842777e78335a97549c3d815f866d1bd650151662a7e23d75fe2b773","observation_id":"f40d4b36-c785-4193-8798-510bb0213b15","resolution":{"observed_at":"2026-08-07T14:27:04.311908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03792","last_updated":"2024-05-02T09:25:38Z","snapshot_observed_at":"2026-07-06T17:40:29.558340Z","submitted_at":"2024-03-06T15:40:30Z","title":"Neural Exec: Learning (and Learning from) Execution Triggers for Prompt Injection Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03792","snapshot_observed_at":"2026-08-07T14:27:03.612380Z","title":"Neural exec: Learning (and learning from) execution triggers for prompt injection attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.612380Z"},"links":{"cited_paper":"/paper/2403.03792","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:31fc1c2d82056c9657dfd3fe4021fc1c5d0fc3127f5a3aaaa5ac3d331a4774b2","observation_id":"c6fa50bd-3b22-4322-b72c-ce82f7a1333f","resolution":{"observed_at":"2026-08-07T14:27:03.612380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:27:03.602300Z","title":"Gpt-4 technical report.arXiv:2303.08774","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.602300Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9715f2e292f5e9ca51b01a7fd9b6b445b9488f5a7a5f5e2ef6f4a290fdad3b47","observation_id":"77b8372a-7ad2-4b67-8a78-a7e57022c71f","resolution":{"observed_at":"2026-08-07T14:27:03.602300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09948","last_updated":"2025-05-29T14:49:44Z","snapshot_observed_at":"2026-07-06T16:48:37.243305Z","submitted_at":"2023-11-16T15:01:48Z","title":"Hijacking Large Language Models via Adversarial In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09948","snapshot_observed_at":"2026-08-07T14:27:03.621418Z","title":"Hijackinglargelanguagemodels via adversarial in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.621418Z"},"links":{"cited_paper":"/paper/2311.09948","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:f02ba1ff5a5e245fe2a49e914621c3386fe66b7e9597e819d895f935bd328606","observation_id":"ce91f6c3-7ae0-4a5f-a822-9edf9615ec9e","resolution":{"observed_at":"2026-08-07T14:27:03.621418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.968853Z","title":"From chatbotstophishbots?:Phishingscamgenerationincommerciallarge languagemodels,in:2024IEEESymposiumonSecurityandPrivacy (SP), IEEE","venue":null,"work_id":"08e47d03-cd29-4f6b-ac01-cd6432c29e0a","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.626005Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:6681f3a506c3fc80ca9832a702fce6f4affa791cb28c4803c3494a66932fd070","observation_id":"26580501-d266-4a08-9291-d8ff75199f53","resolution":{"observed_at":"2026-08-07T14:27:06.004447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-07T14:27:03.616788Z","title":"arXiv preprint arXiv:2211.09527","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.616788Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2f8fe5ceff2688b33c81ae292ddf2547c848c7e81ecd9054cba15bfe984c8d47","observation_id":"a12f2e67-d3ee-4924-85bc-4a8b38807754","resolution":{"observed_at":"2026-08-07T14:27:03.616788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12298","last_updated":"2023-02-21T08:59:22Z","snapshot_observed_at":"2026-07-06T15:19:28.033750Z","submitted_at":"2023-02-21T08:59:22Z","title":"BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12298","snapshot_observed_at":"2026-08-07T14:27:03.635415Z","title":"Badgpt: Exploring security vulnerabilities of chatgpt via backdoor attacks to instructgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.635415Z"},"links":{"cited_paper":"/paper/2304.12298","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e65e11c627e11e2e7deb0091e8e74414638328487e1d2112a799a1d644f25091","observation_id":"24375860-c72e-4ad5-b9c4-f90a96155f81","resolution":{"observed_at":"2026-08-07T14:27:03.635415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.856973Z","title":null,"venue":null,"work_id":"3d679fe4-02d7-4e87-862e-086cd232e705","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.640227Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:64046b450a7fc9a6537e3f91a2d6628cbadb1e3a67cc9c7e0cde599ffc6e8df0","observation_id":"12b4b3aa-060e-4106-80c0-cf97e3f9d79d","resolution":{"observed_at":"2026-08-07T14:27:05.920423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-11T04:10:50.839613Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-07T14:27:03.630698Z","title":"Surveyofvulnerabilitiesinlargelanguagemod- els revealed by adversarial attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.630698Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:de69a89f3ad89dd2a6b5581df5b887fda526e7ba8e180ca22efdc2ec894ad476","observation_id":"3a5fd50e-8463-4378-b555-0104ecddeb33","resolution":{"observed_at":"2026-08-07T14:27:03.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:27:03.655102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.655102Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c1c8c6280af7ea0d617cefa05d62770daa7604e8baaf64dc3d6f15be8b110dd7","observation_id":"cda06f9a-a7ab-4138-8483-610e2173d028","resolution":{"observed_at":"2026-08-07T14:27:03.655102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:27:03.659641Z","title":"Llama2:Openfoundationandfine-tunedchatmodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.659641Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8596df4a228abbae1915c136c789e79614ec87c69f876f63474d3b7a88a2ac6f","observation_id":"345b4c22-c783-4260-9166-3d5cb358380e","resolution":{"observed_at":"2026-08-07T14:27:03.659641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.769697Z","title":"AdvancesinNeural Information Processing Systems 36, 61836–61856","venue":null,"work_id":"dc0de733-f5db-459f-ae3b-5d206dbcd72a","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.645571Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1862eedbed7e65e6dd1d49af11feb8ffede8146560e21ba370a28127f58f8801","observation_id":"3fff1a74-7046-469b-a5d8-c0b24f7ea928","resolution":{"observed_at":"2026-08-07T14:27:05.817837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.643142Z","title":"Wormgpt and fraudgpt – the rise of malicious llms","venue":null,"work_id":"404fea31-8961-4baa-a75a-b5bc690502f8","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.650551Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2b7277012d22436ee307b31ac6b6caa2f361455729f0dd22d5bdd0cbb5b65b68","observation_id":"2440f6fb-d53c-47cf-a777-1a03490ad880","resolution":{"observed_at":"2026-08-07T14:27:05.699816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.449225Z","title":null,"venue":null,"work_id":"9c0176f4-9e5d-4e49-a876-65a5c33c98c2","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.673431Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:991e97c55c0055940725bc7ba9376f9b144ae41cebfd95166fde665cf08881b0","observation_id":"a4ee6f0e-964d-4f5d-8547-a982f9c59d9a","resolution":{"observed_at":"2026-08-07T14:27:05.453509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00944","last_updated":"2023-05-01T16:57:33Z","snapshot_observed_at":"2026-07-06T15:21:57.592347Z","submitted_at":"2023-05-01T16:57:33Z","title":"Poisoning Language Models During Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00944","snapshot_observed_at":"2026-08-07T14:27:03.683845Z","title":"Poisoning language modelsduringinstructiontuning,in:Proc.40thInternationalConfer- ence on Machine Learning (ICML).arXiv:2305.00944","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.683845Z"},"links":{"cited_paper":"/paper/2305.00944","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:bba2e8847d9de0e65b2b874987064f46fda89155b2d6b46baa6b8cb110f7b292","observation_id":"c3c72e84-9a5e-479f-9a66-84669cef5015","resolution":{"observed_at":"2026-08-07T14:27:03.683845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.562059Z","title":"DAN is my new friend.https://old.reddit.c om/r/ChatGPT/comments/zlcyr9/dan_is_my_new_friend/","venue":null,"work_id":"8e0ee09f-4e4b-462a-bd5f-dfa1a2953fd7","year":2022},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.664204Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:b5451618ad76be542995142e5284a7495d0dd9ecc039e6c73d835cc92daef72a","observation_id":"bc0ea891-fa4a-49c0-a147-d83ddf0fe92d","resolution":{"observed_at":"2026-08-07T14:27:05.592228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.466082Z","title":"Universal adversarial triggers for attacking and analyzing nlp, in: EMNLP","venue":null,"work_id":"e94345c3-fea3-4b52-be2c-1f25a6dc2fe7","year":2020},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.668643Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3dd74597b5464303f198d73cac645735fb8c7e55d130e5559510c9bc9ce50b12","observation_id":"f43a025c-03cf-44e5-83f9-236dd5fbf0aa","resolution":{"observed_at":"2026-08-07T14:27:05.502228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04909","last_updated":"2025-06-05T11:44:19Z","snapshot_observed_at":"2026-08-07T10:28:37.330537Z","submitted_at":"2025-06-05T11:44:19Z","title":"When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04909","snapshot_observed_at":"2026-08-07T14:27:03.699530Z","title":"When thinking llms lie: Unveiling the strategic deception in representations of reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.699530Z"},"links":{"cited_paper":"/paper/2506.04909","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1f5dab60e3307810db982923e51d9f26374af1024f329dc91ea3a14e954867ef","observation_id":"dc1e993c-71e8-4590-b811-d4843a5ebd9d","resolution":{"observed_at":"2026-08-07T14:27:03.699530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-10T04:45:11.275468Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-07T14:27:03.678249Z","title":"arXiv preprint arXiv:2404.13208","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.678249Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:de3817c5873f2ffc9ef36e402f1aaa55707e1a098005b626d4e96bbf8ca9283d","observation_id":"7c7786f9-4dbd-4f3b-aa2b-3d99c574d136","resolution":{"observed_at":"2026-08-07T14:27:03.678249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.427071Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems 36, 80079–80110","venue":null,"work_id":"ee3fe2dd-6862-4aa7-9162-afb0651a1ec8","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.710344Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:74aadfb8a5501911517407b5f89fb6b52f374102ce1adbf455ff13d71b12dad4","observation_id":"68defda7-725f-4125-a8fd-b54e3b8798ad","resolution":{"observed_at":"2026-08-07T14:27:05.439142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18666","last_updated":"2025-07-31T04:00:48Z","snapshot_observed_at":"2026-07-06T20:57:47.748881Z","submitted_at":"2025-03-24T13:31:48Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18666","snapshot_observed_at":"2026-08-07T14:27:03.688700Z","title":"Agentspec: Customizable runtime enforcement for safe and reliable llm agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.688700Z"},"links":{"cited_paper":"/paper/2503.18666","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d43b3fe12fc349f47793d2354021990fc4ae39258c1b4c3b1945075ec5dae182","observation_id":"63ce99cb-7ea7-45b3-b288-d427f9a6e538","resolution":{"observed_at":"2026-08-07T14:27:03.688700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09433","last_updated":"2024-08-15T19:51:07Z","snapshot_observed_at":"2026-08-11T00:45:48.191177Z","submitted_at":"2023-11-15T23:07:40Z","title":"Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09433","snapshot_observed_at":"2026-08-07T14:27:03.694102Z","title":"Trojan activation attack: Red-teaming large language models using activation steering for safety-alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.694102Z"},"links":{"cited_paper":"/paper/2311.09433","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9fb57242a98dd06454b6360f62139a79b67f914e37d7c9f336e4fe3af701c568","observation_id":"15125eaa-6240-4c15-bf31-a7767070f8d6","resolution":{"observed_at":"2026-08-07T14:27:03.694102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11355","last_updated":"2025-03-23T06:22:28Z","snapshot_observed_at":"2026-08-07T18:13:59.557870Z","submitted_at":"2025-02-17T02:11:17Z","title":"Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11355","snapshot_observed_at":"2026-08-07T14:27:03.725980Z","title":"Nuclear deployed: Analyzing catastrophic risks in decision-making of autonomous llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.725980Z"},"links":{"cited_paper":"/paper/2502.11355","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:249eb5f74e2ae0ec38ee7aa36d13f4d2bf58daa75dc52fae5a3141b53d354d61","observation_id":"3d99dff0-7482-4de9-a3f6-cb55c68aaff5","resolution":{"observed_at":"2026-08-07T14:27:03.725980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.705501Z","title":"Persona features control emergent misalignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.705501Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2249d45d37b839dc6c6ddb82a354c50ff665573954155f4458379f76f48b9e14","observation_id":"3d4cf9b3-0620-496e-ac16-24d848e360e7","resolution":{"observed_at":"2026-08-07T14:27:03.705501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.271568Z","title":"Asurvey on large language model (llm) security and privacy: The good, the bad, and the ugly","venue":null,"work_id":"f5f67374-7d55-4ad7-adc1-fc45df8309f7","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.736286Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:dc8fb2bba3f3d17c3dc6dd2292617167e2dafaef9be3f95bd27233dfe3d11d0b","observation_id":"9b8871b8-d32b-4189-af08-9dbd0804a0c4","resolution":{"observed_at":"2026-08-07T14:27:05.361858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16667","last_updated":"2024-07-23T17:34:36Z","snapshot_observed_at":"2026-08-10T13:50:49.131833Z","submitted_at":"2024-07-23T17:34:36Z","title":"RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16667","snapshot_observed_at":"2026-08-07T14:27:03.715584Z","title":"Redagent: Red teaming large language models with context-aware autonomous language agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.715584Z"},"links":{"cited_paper":"/paper/2407.16667","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1e8dfcd63b671d93f5de4252ccd3ef8c7e51ad92dd1585747cc6d836d58e395e","observation_id":"64e5fd1a-3be0-4c55-99b3-8395982cc5e0","resolution":{"observed_at":"2026-08-07T14:27:03.715584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18349","last_updated":"2024-08-08T08:57:23Z","snapshot_observed_at":"2026-08-06T14:40:09.150498Z","submitted_at":"2024-03-27T08:39:56Z","title":"Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18349","snapshot_observed_at":"2026-08-07T14:27:03.720278Z","title":"Rejection improves reliability: Training llms to refuse un- known questions using rl from knowledge feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.720278Z"},"links":{"cited_paper":"/paper/2403.18349","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:25f5114f8d1d2407336aad8d583937360eaab6cfb066a251bd57c4795c853888","observation_id":"702d2ad4-02d6-4f69-82be-ff06d645237e","resolution":{"observed_at":"2026-08-07T14:27:03.720278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.132912Z","title":null,"venue":null,"work_id":"bb736e89-ae49-4b01-a35f-f24f871c774c","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.750500Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:083d479c819c1fe4330181797fd90ebe476922e65afb73485885991f944af521","observation_id":"c1a8b09f-38b2-4f95-b3b9-29b4a8fdcfa5","resolution":{"observed_at":"2026-08-07T14:27:05.197213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16888","last_updated":"2024-04-03T05:53:20Z","snapshot_observed_at":"2026-07-06T16:00:50.467537Z","submitted_at":"2023-07-31T17:56:00Z","title":"Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16888","snapshot_observed_at":"2026-08-07T14:27:03.730949Z","title":"Backdooring instruction-tuned large language models with virtual prompt injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.730949Z"},"links":{"cited_paper":"/paper/2307.16888","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2b71384d4c49016128c6bca5acbadfd927aee81a155c5a9120cf95f88cb5ef7d","observation_id":"8b9d043f-428c-4a8d-adb8-edbe1f111dcf","resolution":{"observed_at":"2026-08-07T14:27:03.730949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15754","last_updated":"2025-03-20T00:13:04Z","snapshot_observed_at":"2026-08-10T14:56:44.035063Z","submitted_at":"2025-03-20T00:13:04Z","title":"AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15754","snapshot_observed_at":"2026-08-07T14:27:03.764785Z","title":"Autoredteamer: Autonomous red teaming with lifelong attack integration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.764785Z"},"links":{"cited_paper":"/paper/2503.15754","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3bf142ec3a5295ebf034fa5825802ed321c01738de8d914297c9057a94955e11","observation_id":"9a515249-b67b-43be-8da3-9b87c3a00f40","resolution":{"observed_at":"2026-08-07T14:27:03.764785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00055","last_updated":"2024-12-28T07:48:57Z","snapshot_observed_at":"2026-08-10T23:33:11.981274Z","submitted_at":"2024-12-28T07:48:57Z","title":"LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00055","snapshot_observed_at":"2026-08-07T14:27:03.740914Z","title":"Llm-virus: Evolutionary jailbreak attack on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.740914Z"},"links":{"cited_paper":"/paper/2501.00055","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1e6a66503958043aca735e4b462f698af4002a33b8b03d2b73664a57dd7e4851","observation_id":"bb96e0a4-8b38-43f2-ace2-cc8a809bae58","resolution":{"observed_at":"2026-08-07T14:27:03.740914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08109","last_updated":"2025-08-10T02:49:05Z","snapshot_observed_at":"2026-08-05T10:27:24.738852Z","submitted_at":"2024-10-10T16:56:05Z","title":"A Closer Look at Machine Unlearning for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08109","snapshot_observed_at":"2026-08-07T14:27:03.745848Z","title":"A closer look at machine unlearning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.745848Z"},"links":{"cited_paper":"/paper/2410.08109","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:b7e880972f08b1d063189a991e641b3b9205e5a82615d2a598be8fc7473008f3","observation_id":"2499618d-1ed2-418d-b7ba-c5cbdc64ff78","resolution":{"observed_at":"2026-08-07T14:27:03.745848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13666","last_updated":"2025-07-25T06:20:38Z","snapshot_observed_at":"2026-08-11T12:52:37.793567Z","submitted_at":"2024-12-18T09:48:53Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","version":2},"cited_work":{"arxiv_id":"2412.13666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13666","snapshot_observed_at":"2026-08-07T14:27:03.818131Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","venue":"cs.CL","work_id":"b9863fd1-6737-4adb-b577-f892ec2a7ec0","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.780401Z"},"links":{"cited_paper":"/paper/2412.13666","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1a236f7f51056fe9af9cfe54cb4fe3e537ee738f623b4e851d3aae34e6499d3c","observation_id":"57120ddb-8970-4d96-b258-a53bc8fb3204","resolution":{"observed_at":"2026-08-07T14:27:03.825519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:04.994331Z","title":null,"venue":null,"work_id":"c429feef-ff81-4c45-b12e-012b61746e77","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.754737Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:5908fa916916d03f2e2d300dde1dfb83ca896518b016221945e053264fccd798","observation_id":"82d11667-9a15-4cae-a3fd-e0a0b67e667d","resolution":{"observed_at":"2026-08-07T14:27:05.063421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-08-10T23:27:47.979166Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-07T14:27:03.759736Z","title":"arXiv preprint arXiv:2401.17256","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.759736Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:f584274a60cc623162b4f3679c3205016f1bca1e9ad21aa16daa9851c31c7ce6","observation_id":"eb482b29-547d-4846-bd6b-42e9cf4b000f","resolution":{"observed_at":"2026-08-07T14:27:03.759736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.770830Z","title":"Ad- vprefix: An objective for nuanced llm jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.770830Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:fde373a1832075a9f66d0d9eb18189d9616f78081161cc069ed1ede6cdbe58a2","observation_id":"ab4d47a7-5cae-41a2-9f9f-014b5ea4b4b0","resolution":{"observed_at":"2026-08-07T14:27:03.770830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T14:27:03.775471Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.775471Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e6d57197e28ea5cd2d5ce00ecf4831460db871ce270290a7388f37f3268c1794","observation_id":"6956a007-7c79-41f6-9f67-bbae36cce66c","resolution":{"observed_at":"2026-08-07T14:27:03.775471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T14:27:03.440620Z","title":"arXiv preprint arXiv:2310.12773","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.440620Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:97d38ebd237c5ed6717c44d23bad276da49180807ed54551ff9e11c93445e017","observation_id":"099fde57-8128-44e5-a0b5-d7ee8ff11def","resolution":{"observed_at":"2026-08-07T14:27:03.440620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-07T14:27:03.495748Z","title":"arXiv preprint arXiv:2401.05566","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.495748Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:67b7997dd91a082d8f6ae50f19015eaab154ed241348a6fe4bbfe779624b063b","observation_id":"f03154d5-a4b3-4d51-a0de-e83b582db2b2","resolution":{"observed_at":"2026-08-07T14:27:03.495748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","latest_version":5,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":5,"verified_fuzzy":18},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 7 inbound Pith citation observations for arXiv:2505.18889."}