{"as_of":"2026-08-12T15:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:839ee6df6f19d3ac266cc9917135e662f12d487db34d77f3453a8dea45cd9e8d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":80,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:53:15.305158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":21,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:209c3ff1ec57cbf1b976ca9b03994b12be7364ad0cfc239c6ea8bf3985979011","observation_id":"117d23d0-55a9-4849-8078-a4f74db8fd9c","resolution":{"observed_at":"2026-05-15T02:20:44.426486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-11T18:41:06.153149Z","title":"arXiv preprint arXiv:2310.06387 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07672","last_updated":"2024-12-10T17:02:28Z","snapshot_observed_at":"2026-08-12T09:07:42.055625Z","submitted_at":"2024-12-10T17:02:28Z","title":"FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:41:06.153149Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2412.07672"},"observation_digest":"sha256:7f3bf6831d28cff259bffca1595dee0de686d92f61963f53759724597989d015","observation_id":"9ca19ab0-3dea-4262-820a-f10d6891b276","resolution":{"observed_at":"2026-08-11T18:41:06.153149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-11T18:53:15.305158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10423","last_updated":"2025-04-14T12:52:24Z","snapshot_observed_at":"2026-08-11T18:46:04.704591Z","submitted_at":"2024-12-10T12:42:33Z","title":"Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:53:15.305158Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2412.10423"},"observation_digest":"sha256:55c3b96d2aa06ea45e5b8c8a24d4c0e2a21de1aa0e5d83c136e41164773ea739","observation_id":"c95fb98b-469c-4d12-a165-66b54dc5fc35","resolution":{"observed_at":"2026-08-11T18:53:15.305158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-11T15:49:38.142015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12192","last_updated":"2024-12-13T23:58:12Z","snapshot_observed_at":"2026-08-11T16:28:58.655337Z","submitted_at":"2024-12-13T23:58:12Z","title":"No Free Lunch for Defending Against Prefilling Attack by In-Context Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:49:38.142015Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2412.12192"},"observation_digest":"sha256:7816de1ed306bb28447b78dfb747797c214218902e92bdee75a54fe921529daa","observation_id":"6fedc0ca-9974-49fb-8a0f-8024c1a93efe","resolution":{"observed_at":"2026-08-11T15:49:38.142015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-11T12:47:48.601255Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13821","last_updated":"2024-12-18T13:10:35Z","snapshot_observed_at":"2026-08-11T14:37:42.144730Z","submitted_at":"2024-12-18T13:10:35Z","title":"Towards Responsible Governing AI Proliferation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T12:47:48.601255Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2412.13821"},"observation_digest":"sha256:4c9a0c8782c7008689d8784e7b12402de31b3e7f2ea7dcc26d06de21139c6200","observation_id":"d24f0f6a-2382-49ba-b029-bfaf1f3e4515","resolution":{"observed_at":"2026-08-11T12:47:48.601255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-11T05:02:26.713244Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18171","last_updated":"2024-12-25T02:15:50Z","snapshot_observed_at":"2026-08-12T09:07:10.978568Z","submitted_at":"2024-12-24T05:10:02Z","title":"Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:26.713244Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2412.18171"},"observation_digest":"sha256:e91e2cf631c9e765e9026a4223658883a049db93a4540f9883ed4353305ba8e6","observation_id":"4cfd5c5e-551a-4de1-8066-5a1b12d2d127","resolution":{"observed_at":"2026-08-11T05:02:26.713244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T23:40:38.873180Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00055","last_updated":"2024-12-28T07:48:57Z","snapshot_observed_at":"2026-08-10T23:33:11.981274Z","submitted_at":"2024-12-28T07:48:57Z","title":"LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:40:38.873180Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.00055"},"observation_digest":"sha256:d92c2f3a8d8216c796cbcaac8f4d88109cfdcdf0ceac6844cb23b8ca0cea6f14","observation_id":"9cc1274f-7c2e-475b-99c0-af3b7e4c34ac","resolution":{"observed_at":"2026-08-10T23:40:38.873180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:28:56.732300Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01765","last_updated":"2025-01-03T11:34:28Z","snapshot_observed_at":"2026-08-11T03:48:10.872244Z","submitted_at":"2025-01-03T11:34:28Z","title":"SaLoRA: Safety-Alignment Preserved Low-Rank Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:28:56.732300Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.01765"},"observation_digest":"sha256:5db369bc077330b0c0f81b8961c97c9fefdab17d5cca1b8389ab85cbd39d2e10","observation_id":"7ef6edf3-7144-427a-8a56-67f480a69451","resolution":{"observed_at":"2026-08-10T22:28:56.732300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:25:54.723257Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-12T09:57:48.731669Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.723257Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:163bac9dd8b36002240a40c790668069dd45c8a8a8c57a8b59501cf88d0d6641","observation_id":"962b564d-6ac9-41c1-8db9-b5cc36a03762","resolution":{"observed_at":"2026-08-10T22:25:54.723257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:35:26.984854Z","title":"arXiv preprint arXiv:2310.06387","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-12T11:52:23.797469Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.984854Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:b3e4867ab5d08bf1f3fbec9c46cea6f47f6470fa25dfdf5e4c0dabffbfd332e1","observation_id":"d6ef1e05-0fd2-4d45-bd4d-a8d6458c5f61","resolution":{"observed_at":"2026-08-10T22:35:26.984854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:11:59.912758Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02629","last_updated":"2025-02-12T04:55:19Z","snapshot_observed_at":"2026-08-11T19:10:26.004809Z","submitted_at":"2025-01-05T19:06:03Z","title":"Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:11:59.912758Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.02629"},"observation_digest":"sha256:657dd05624ee6930d3fda5d99420edc2b06f9a0ed292ea7eb60c939609e15f8f","observation_id":"6d605eed-3151-4592-a9e4-07be3a451d65","resolution":{"observed_at":"2026-08-10T22:11:59.912758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T20:35:52.856473Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07959","last_updated":"2025-02-01T09:30:34Z","snapshot_observed_at":"2026-08-12T00:45:00.001520Z","submitted_at":"2025-01-14T09:23:30Z","title":"Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:52.856473Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.07959"},"observation_digest":"sha256:3eec301bb7325ed81188f1e7f65ceb656a00baf6fcb52174b0f5cbcd21870113","observation_id":"ed581a41-2e19-4c3a-93a0-50d01a279b19","resolution":{"observed_at":"2026-08-10T20:35:52.856473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T19:08:01.737120Z","title":", author Wang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-10T18:59:36.542278Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.737120Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:496d9e22b49a414073373c483f92bd9aa090c7f0ddfa2958ad1cbb05d506e8f1","observation_id":"19cf3e0d-9de7-48fe-b988-f87b47517819","resolution":{"observed_at":"2026-08-10T19:08:01.737120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T17:58:18.112923Z","title":"Jailbreak and guard aligne d lan- guage models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11739","last_updated":"2025-01-22T15:09:02Z","snapshot_observed_at":"2026-08-11T17:50:42.781653Z","submitted_at":"2025-01-20T20:54:06Z","title":"Episodic memory in AI agents poses risks that should be studied and mitigated","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T17:58:18.112923Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.11739"},"observation_digest":"sha256:b510028b9b4035641cd6f4fcd34ac6035457b32990458210b82094ec06a2f2b3","observation_id":"cb412c3f-1d20-49c5-8853-766be59699f9","resolution":{"observed_at":"2026-08-10T17:58:18.112923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T14:38:10.811952Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15145","last_updated":"2025-04-12T02:58:59Z","snapshot_observed_at":"2026-08-11T19:46:34.722732Z","submitted_at":"2025-01-25T09:03:19Z","title":"PromptShield: Deployable Detection for Prompt Injection Attacks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:10.811952Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.15145"},"observation_digest":"sha256:e0d553f2d9a7141b1dfdca42f1e4d3e5266f2739ecb0cb61416c2c70548d8a97","observation_id":"0175743d-88fe-4eb6-9851-69008c436cdf","resolution":{"observed_at":"2026-08-10T14:38:10.811952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T00:12:04.817181Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18280","last_updated":"2025-05-17T04:37:43Z","snapshot_observed_at":"2026-08-11T14:23:02.047375Z","submitted_at":"2025-01-30T11:37:40Z","title":"Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T00:12:04.817181Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.18280"},"observation_digest":"sha256:1f14d621415464841020378d3f2825783a1984425450f89a8549e7b03dbff04b","observation_id":"0f26dd78-4c35-4556-8f79-98f7892de47d","resolution":{"observed_at":"2026-08-10T00:12:04.817181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-09T14:02:38.908552Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01925","last_updated":"2025-06-12T19:46:44Z","snapshot_observed_at":"2026-08-12T09:07:41.364971Z","submitted_at":"2025-02-04T01:51:31Z","title":"PANDAS: Improving Many-shot Jailbreaking via Positive Affirmation, Negative Demonstration, and Adaptive Sampling","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T14:02:38.908552Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2502.01925"},"observation_digest":"sha256:f557a4f599a4afbbd6e674d63b00054a922b240fb79bd1bc8894e879f76fbc12","observation_id":"a928bc4c-1dd2-43bd-862a-186b3966b4c8","resolution":{"observed_at":"2026-08-09T14:02:38.908552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-08T12:25:30.673565Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07557","last_updated":"2025-02-11T13:50:50Z","snapshot_observed_at":"2026-08-11T19:18:54.639349Z","submitted_at":"2025-02-11T13:50:50Z","title":"JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:30.673565Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2502.07557"},"observation_digest":"sha256:2e4ab1b1f1a36f8be95056a79f76f0959079e8e2627b758326985a24ff989e44","observation_id":"e184b199-3148-4634-bc49-02b558a134dc","resolution":{"observed_at":"2026-08-08T12:25:30.673565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-08T11:15:45.010325Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07985","last_updated":"2025-04-07T09:15:30Z","snapshot_observed_at":"2026-08-09T21:19:05.447490Z","submitted_at":"2025-02-11T22:06:25Z","title":"MetaSC: Test-Time Safety Specification Optimization for Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T11:15:45.010325Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2502.07985"},"observation_digest":"sha256:c369eb801a243c42f1783a9061f629f3196ceda4865c195143ed1e428b7f6064","observation_id":"e2a488f1-08c4-43a6-a2a4-94b88f78a080","resolution":{"observed_at":"2026-08-08T11:15:45.010325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T15:15:18.326956Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T20:58:02.100576Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.326956Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:f126a975f7378e432f933ffa53309a0a6f1b1efa8d21dff46a8ed12b9c5e37c6","observation_id":"cba2e2e6-8940-425b-aecc-e698ad06b693","resolution":{"observed_at":"2026-08-07T15:15:18.326956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T15:15:48.745729Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15753","last_updated":"2025-05-21T16:58:14Z","snapshot_observed_at":"2026-08-07T15:09:59.174634Z","submitted_at":"2025-05-21T16:58:14Z","title":"Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:48.745729Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.15753"},"observation_digest":"sha256:db8d9f4099e843892e5e818e22b867ffadbc9ed99f7ff006118a866c0ce9b059","observation_id":"9bdd8198-b371-4ea6-b84c-bdc93100f652","resolution":{"observed_at":"2026-08-07T15:15:48.745729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T15:03:41.028053Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16446","last_updated":"2025-05-22T09:34:47Z","snapshot_observed_at":"2026-08-10T16:10:06.341959Z","submitted_at":"2025-05-22T09:34:47Z","title":"Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:41.028053Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.16446"},"observation_digest":"sha256:cbd5580438fc424a1d84d6898adde4dfb1687b2434fab698576daaaab5f6c7f0","observation_id":"380184e7-86ed-4d1d-acad-bd528028193c","resolution":{"observed_at":"2026-08-07T15:03:41.028053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2505.16737","last_updated":"2026-04-23T08:31:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T14:52:10Z","title":"Secure LLM Fine-Tuning via Safety-Aware Probing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:09.402763Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.16737"},"observation_digest":"sha256:bc2b662d139c5e0f1422016a9f6cb1922ace5c7c79ba0d9b5ea276ed13a90c3b","observation_id":"6f79f5c5-dadf-42b5-871f-460fbc8e94b7","resolution":{"observed_at":"2026-05-22T13:11:35.853681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T14:32:30.720380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-11T17:14:11.420412Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:30.720380Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:9ceda1cf4f483e4fdf2ddd93d97785d850409f2d494703514212ec12187c6be6","observation_id":"50dc41cf-1536-4e7b-869a-64ad6d1d0615","resolution":{"observed_at":"2026-08-07T14:32:30.720380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T14:01:11.052058Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21556","last_updated":"2025-05-26T17:27:32Z","snapshot_observed_at":"2026-08-11T03:01:04.883037Z","submitted_at":"2025-05-26T17:27:32Z","title":"Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:11.052058Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.21556"},"observation_digest":"sha256:f35ae04d25488e1a0a179df587ff2abaf5199c4d66394bfd55aa9281009e8a58","observation_id":"315c024d-59f5-4a55-8fe7-56370521a7b3","resolution":{"observed_at":"2026-08-07T14:01:11.052058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T13:17:24.102566Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.06387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22271","last_updated":"2025-05-28T11:57:46Z","snapshot_observed_at":"2026-08-11T15:52:14.797046Z","submitted_at":"2025-05-28T11:57:46Z","title":"Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:24.102566Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.22271"},"observation_digest":"sha256:9f3e6b9a804bbb524724a0e0ade41b7ef6418c903138e93652d47d724daa8329","observation_id":"73d2de4a-8bd0-44b0-b6e4-7b1dec2610c8","resolution":{"observed_at":"2026-08-07T13:17:24.102566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T12:37:22.236454Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.06387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.236454Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:0924997c07457b3904c65c21f72d225492632ada32299c30e654d1aa0b2c63c3","observation_id":"5faeabe1-ec16-46fd-8fbe-ec8a76ffd52e","resolution":{"observed_at":"2026-08-07T12:37:22.236454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:1fe13301609f4b8f0fae8d937afba355ba87ee4672221cfd998dd216cb7a95df","observation_id":"75792518-7d97-4fe7-917b-fcd454ccace3","resolution":{"observed_at":"2026-05-19T11:37:15.987956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T11:11:40.551096Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.06387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-10T20:18:21.272344Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.551096Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:bd98b9b81649ac6804c8ba414a0da1cc12db7a4819679b8da9fb1b32e9690f2a","observation_id":"60f67dd0-5532-4871-9215-078dcc65b23a","resolution":{"observed_at":"2026-08-07T11:11:40.551096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T05:36:58.135736Z","title":"Jail- break and Guard Aligned Language Models with Only Few In-Context Demonstrations.arXiv preprint arXiv:2310.06387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07596","last_updated":"2025-06-09T09:54:25Z","snapshot_observed_at":"2026-08-11T07:41:09.208637Z","submitted_at":"2025-06-09T09:54:25Z","title":"TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:58.135736Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.07596"},"observation_digest":"sha256:35c4f84b9fb8408d9e10b6982cf447016df65703d0488e2602d216028b871b0e","observation_id":"abd6921c-f91f-4c0e-b1af-47bf8baa381a","resolution":{"observed_at":"2026-08-07T05:36:58.135736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2506.09067","last_updated":"2026-04-09T22:50:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-08T16:26:51Z","title":"Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T10:54:55.262180Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.09067"},"observation_digest":"sha256:f90613ec38ba03f0b2a93b532f173c3d248318ffa44649588f9e97d6a5a8f7e0","observation_id":"de60991d-b09f-4bc5-815e-e386c2095b22","resolution":{"observed_at":"2026-05-19T10:57:16.542808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T05:35:10.112904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10022","last_updated":"2025-06-09T12:02:39Z","snapshot_observed_at":"2026-08-10T14:10:26.170712Z","submitted_at":"2025-06-09T12:02:39Z","title":"LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:35:10.112904Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.10022"},"observation_digest":"sha256:5c3eb678ae27abc7ea99136adc98ccc3ab08dd020b19ba0b9c3ac4c6fe6e427b","observation_id":"b255213c-9252-42fc-8015-5501bcc45f5a","resolution":{"observed_at":"2026-08-07T05:35:10.112904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T10:17:27.001406Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:27.001406Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:529e63f1f5faae6172cb95f5b5179990d5b553f9d4127ba24f897ab7e7db0060","observation_id":"0bfa0aee-8356-4b43-a9f4-82adba2f8a86","resolution":{"observed_at":"2026-08-07T10:17:27.001406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T01:02:31.037588Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12274","last_updated":"2025-06-13T23:03:11Z","snapshot_observed_at":"2026-08-11T21:14:39.344838Z","submitted_at":"2025-06-13T23:03:11Z","title":"InfoFlood: Jailbreaking Large Language Models with Information Overload","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:02:31.037588Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.12274"},"observation_digest":"sha256:afaad0516ccd6851d2358af5ce43ff2fac545b1c422a71795bb429bf479c0940","observation_id":"55f36b96-93fa-4d92-8919-e1cc47c74088","resolution":{"observed_at":"2026-08-07T01:02:31.037588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T23:20:53.797609Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.063872023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.797609Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:17431d4c282e78587200947b90d2294f1ebbaccb6d1138a2e2a6784f193e2790","observation_id":"acd11a48-ed3f-4c4d-be94-32473105ddd4","resolution":{"observed_at":"2026-08-06T23:20:53.797609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T21:27:35.014424Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.014424Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:c62fecb01f32a4fedbdb7000c2661ade36247f02716b42c816114fb3663d4c39","observation_id":"c8564b34-057e-407c-bf81-6ed1135155b4","resolution":{"observed_at":"2026-08-06T21:27:35.014424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T18:32:42.838856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07974","last_updated":"2025-08-25T16:49:10Z","snapshot_observed_at":"2026-08-11T07:05:15.466298Z","submitted_at":"2025-07-10T17:51:05Z","title":"Defending Against Prompt Injection With a Few DefensiveTokens","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:42.838856Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.07974"},"observation_digest":"sha256:5a3336e645f65cb219a93010bacffea546f85fd3d8b7cf05836a6997a519a3cd","observation_id":"c9e12c66-942d-4f13-b196-686c4bf8756d","resolution":{"observed_at":"2026-08-06T18:32:42.838856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T19:26:13.743717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-10T03:17:23.421233Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.743717Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:a9c43a31bd3c07d225f41fd744acd5b8cf49175534589922f86a4bce83be8ea0","observation_id":"78c43e03-bdbb-458f-83aa-5413134e33b9","resolution":{"observed_at":"2026-08-06T19:26:13.743717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T16:25:55.100347Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13761","last_updated":"2025-07-18T09:13:05Z","snapshot_observed_at":"2026-08-09T17:23:00.228187Z","submitted_at":"2025-07-18T09:13:05Z","title":"Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:25:55.100347Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.13761"},"observation_digest":"sha256:e3c337d8b9f5a7eaffaa4ff3a692cc7c5928d3b36806accaa642c3511b6dc055","observation_id":"bf2e2b86-141e-493b-a58e-0e75f00be4e4","resolution":{"observed_at":"2026-08-06T16:25:55.100347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T14:17:34.156403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19598","last_updated":"2025-07-25T18:11:10Z","snapshot_observed_at":"2026-08-08T09:36:36.194652Z","submitted_at":"2025-07-25T18:11:10Z","title":"MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T14:17:34.156403Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2507.19598"},"observation_digest":"sha256:97c2618fe831fb507eade88f1b8f0e96bef399cf907e2d084975d16b1ce53440","observation_id":"f0d19bb1-5cea-4a7d-928b-271ecf66ead2","resolution":{"observed_at":"2026-08-06T14:17:34.156403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T05:43:39.293986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01306","last_updated":"2025-08-02T10:36:01Z","snapshot_observed_at":"2026-08-11T02:10:38.473408Z","submitted_at":"2025-08-02T10:36:01Z","title":"PUZZLED: Jailbreaking LLMs through Word-Based Puzzles","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:39.293986Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.01306"},"observation_digest":"sha256:772d14b34ac1a8d10c8ab9540a413187bca7b5b9bee31f8d5d6b1368f2d3dd01","observation_id":"218856ef-8017-4313-b7d8-3c4288aa9d6f","resolution":{"observed_at":"2026-08-06T05:43:39.293986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T00:04:25.504135Z","title":"Wei, A.; Haghtalab, N.; and Steinhardt, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04451","last_updated":"2025-08-06T13:52:00Z","snapshot_observed_at":"2026-08-08T06:32:27.530658Z","submitted_at":"2025-08-06T13:52:00Z","title":"Automatic LLM Red Teaming","version":1},"reference_index":1685,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:25.504135Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.04451"},"observation_digest":"sha256:fc44872ebbbf8616938f93dae462b168ae1cb00838431eb90fb06e44e90d91ea","observation_id":"b53d180c-a509-4bc2-8d06-8efb4e8c110b","resolution":{"observed_at":"2026-08-06T00:04:25.504135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T22:24:23.428703Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demon- strations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.428703Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:aa8b5951fc80fa012c4b496239c602113106ce7a83f6fcac00846db0858811b2","observation_id":"11d2042c-6acd-4c2f-8ba3-21a2845c9a02","resolution":{"observed_at":"2026-08-05T22:24:23.428703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T21:18:48.551115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09016","last_updated":"2025-09-10T05:08:47Z","snapshot_observed_at":"2026-08-09T06:48:43.608452Z","submitted_at":"2025-08-12T15:30:44Z","title":"A Survey on Training-free Alignment of Large Language Models","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T21:18:48.551115Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.09016"},"observation_digest":"sha256:210a52f88a223aa52bd18cda58723af3153daf8822f98f2013b2c5d201a71491","observation_id":"7bbdb906-2757-4b09-abf5-0001b09d1ebc","resolution":{"observed_at":"2026-08-05T21:18:48.551115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T20:31:41.559678Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.559678Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:f5a86c9bf1fc4ba8a1ce3320c2bc64e662bc108100f01d44ca6901dde4a75647","observation_id":"3e071d78-c297-4a80-8084-43d8cac74c4f","resolution":{"observed_at":"2026-08-05T20:31:41.559678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T18:05:32.424178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15182","last_updated":"2025-08-21T02:39:14Z","snapshot_observed_at":"2026-08-08T01:21:32.994965Z","submitted_at":"2025-08-21T02:39:14Z","title":"SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:05:32.424178Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.15182"},"observation_digest":"sha256:31d7a17659a51bd0060203b1b00b69606a9e3e103d0768f819e511c533480090","observation_id":"103a5d3e-866c-42b7-a0b0-5c77d922d988","resolution":{"observed_at":"2026-08-05T18:05:32.424178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T16:00:52.110346Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:52.110346Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:4deb3d3073fe5082992ec46b4f7dc799a7349e18d06235e54453c5c7821a8cca","observation_id":"fe642ff8-1d94-4870-a75b-bc2df70e9cc0","resolution":{"observed_at":"2026-08-05T16:00:52.110346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2508.20325","last_updated":"2026-05-11T14:12:43Z","snapshot_observed_at":"2026-07-06T22:19:48.389341Z","submitted_at":"2025-08-28T00:07:10Z","title":"GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T21:34:51.665401Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.20325"},"observation_digest":"sha256:596462a92d549ff6fa2cb4c941a4290d35918ec8522cd02bfe665160e4aaefea","observation_id":"921a1417-8384-499b-97e9-4bdae34b8f08","resolution":{"observed_at":"2026-05-18T21:36:52.479691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T11:50:14.742567Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-05T11:50:10.014003Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:14.742567Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2509.02208"},"observation_digest":"sha256:e8d6844939b79a4832b97b849305aa65a3b53f6353ce925574a7b18368b52dd0","observation_id":"262a77df-7593-46d2-b169-d8fe64bae7d3","resolution":{"observed_at":"2026-08-05T11:50:14.742567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T10:39:08.207569Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":264,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:08.207569Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:42e71033ca79259e8d86b161cf09cb932b9051fbc40fbc83d15f474c84fd824b","observation_id":"fcf06fb2-f84c-486c-9e38-4c9f4c0ca189","resolution":{"observed_at":"2026-08-05T10:39:08.207569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-04T23:09:41.470662Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.470662Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4d22f8f495024ca95981c1777d0b605d8332af8c3b01f516bedaf797fd2b389f","observation_id":"881ed3e0-8875-48cf-a485-a295d796bf27","resolution":{"observed_at":"2026-08-04T23:09:41.470662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-04T09:25:57.778089Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.CoRR, abs/2310.06387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-06T02:45:04.316908Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:57.778089Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:bdcaddc0eeec6beab7c142de73e9c30245ca362933efd40930333eeab24b7f22","observation_id":"bb991391-33fa-4d40-b1c4-1646f578c6a8","resolution":{"observed_at":"2026-08-04T09:25:57.778089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:1fa0396a454da99c25ea8db46797de565383b46bd303545daf176aa5fde6a09e","observation_id":"8b9af65f-eef9-4e39-b148-2c7c4b2f4287","resolution":{"observed_at":"2026-05-18T05:25:54.630924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-04T07:06:38.120540Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.06387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27140","last_updated":"2026-07-07T02:18:26Z","snapshot_observed_at":"2026-08-07T23:25:01.868478Z","submitted_at":"2025-10-31T03:35:59Z","title":"Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T07:06:38.120540Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2510.27140"},"observation_digest":"sha256:51dc84bb1bb3c20b05973a9114b80d2c419a5396b8a52fc10299c73b85baec49","observation_id":"5187e3f8-ddbc-49ef-b93f-23f7013e2313","resolution":{"observed_at":"2026-08-04T07:06:38.120540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2511.02356","last_updated":"2026-04-20T12:25:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-04T08:24:22Z","title":"ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T01:54:22.995178Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2511.02356"},"observation_digest":"sha256:37b00b121937c74156c7b1ba7683a066502c5b5a01a90b8e171852118ebbd753","observation_id":"e241d81d-697b-4658-86dc-2532dc2b8cd0","resolution":{"observed_at":"2026-05-18T01:55:38.050506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2602.00979","last_updated":"2026-05-22T03:20:51Z","snapshot_observed_at":"2026-08-03T15:56:56.036971Z","submitted_at":"2026-02-01T02:39:51Z","title":"GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T07:02:28.660002Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2602.00979"},"observation_digest":"sha256:405cb022c4442b4c35e5bbb45e3b33f708677a2b6ac95894c01661fc96d1c1f6","observation_id":"1c861905-1bde-4f80-b222-a54f7756b3e8","resolution":{"observed_at":"2026-05-25T07:05:26.677753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2603.00822","last_updated":"2026-05-04T08:55:15Z","snapshot_observed_at":"2026-08-10T00:49:51.645551Z","submitted_at":"2026-02-28T21:56:47Z","title":"ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T17:49:08.192347Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2603.00822"},"observation_digest":"sha256:d7dcf0e51aea4a2c8a576e50da2924de279ee7752ce7fed649591dc71dee3a73","observation_id":"b6802b60-e140-435f-8723-813ea5ddc511","resolution":{"observed_at":"2026-05-15T17:50:12.375753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.07727","last_updated":"2026-04-09T02:22:44Z","snapshot_observed_at":"2026-08-11T01:30:41.906955Z","submitted_at":"2026-04-09T02:22:44Z","title":"TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:19.922383Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.07727"},"observation_digest":"sha256:0592767c37d9d44dbfd0ba8de68afba7e71e82a81dbd4064d0d6b4475125129f","observation_id":"b6f4ff22-d27a-4aa8-b762-1b9e0680ce30","resolution":{"observed_at":"2026-05-11T00:35:50.778962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.09222","last_updated":"2026-08-07T05:55:06Z","snapshot_observed_at":"2026-08-12T15:09:32.599947Z","submitted_at":"2026-04-10T11:27:25Z","title":"GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:40:59.993298Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.09222"},"observation_digest":"sha256:4228f437a180d98a5afa815d3f245126d5d06f3ab443e73b28dd35aa59cc1049","observation_id":"3d58642f-7d0f-43f0-9c67-768094314bbb","resolution":{"observed_at":"2026-05-10T16:45:37.340698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.12232","last_updated":"2026-04-14T03:12:19Z","snapshot_observed_at":"2026-08-11T14:51:38.020535Z","submitted_at":"2026-04-14T03:12:19Z","title":"TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:52.006859Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.12232"},"observation_digest":"sha256:c9176e37cc7f20dba860b2ccd5354e6d9b92662d5f140ad798a9b07ef268b9c2","observation_id":"25c6cce4-a38e-4317-b3ab-66456ab89088","resolution":{"observed_at":"2026-05-11T09:26:00.015367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"Jailbreak and Guard Aligned Language Models with Only Few in-Context Demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:397440c593ea85814fcbf4954e41da46865ed3c21739784dea1f8d44b8870a37","observation_id":"7b10e68e-4c58-4538-949f-52ec49ce67bb","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-11T08:37:21.535936Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:b04db64204d93276a2cf52ea2d32ca6d8ee82855801f14cfa93c208abc4015ce","observation_id":"f2448a1f-80b8-4bbe-b1be-faeaf618d404","resolution":{"observed_at":"2026-05-10T11:35:18.931019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.15789","last_updated":"2026-04-17T07:50:42Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:50:42Z","title":"A Systematic Study of Training-Free Methods for Trustworthy Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T08:19:42.671690Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.15789"},"observation_digest":"sha256:ad2c2ffe5aa02b49d3680331365919716be85e96a337f424679d8ccd121ca287","observation_id":"75fea871-0b2c-455e-b68a-69d3a924bc36","resolution":{"observed_at":"2026-05-10T08:22:37.353269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.17053","last_updated":"2026-04-18T16:22:25Z","snapshot_observed_at":"2026-08-11T15:02:04.765372Z","submitted_at":"2026-04-18T16:22:25Z","title":"Jailbreaking Large Language Models with Morality Attacks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T06:17:14.242224Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.17053"},"observation_digest":"sha256:2bbd9d420ae515ad17b90fc3f9633bd040ef0ee585e9e0be34691fcddb7a194f","observation_id":"c0804e6e-5974-4d59-9fc7-fcc348e25e30","resolution":{"observed_at":"2026-05-10T06:21:27.030426Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.19638","last_updated":"2026-04-21T16:27:20Z","snapshot_observed_at":"2026-08-11T13:56:53.724081Z","submitted_at":"2026-04-21T16:27:20Z","title":"SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T02:21:29.463149Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.19638"},"observation_digest":"sha256:44ab31d699cce8601674469f886329219637ae76533ac50162d5031836510530","observation_id":"654cd810-3283-4979-be35-e00290ea9fe6","resolution":{"observed_at":"2026-05-11T13:06:04.411354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.22427","last_updated":"2026-04-24T10:38:40Z","snapshot_observed_at":"2026-08-11T00:18:21.676856Z","submitted_at":"2026-04-24T10:38:40Z","title":"Automation-Exploit: A Multi-Agent LLM Framework for Adaptive Offensive Security with Digital Twin-Based Risk-Mitigated Exploitation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:21.608035Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.22427"},"observation_digest":"sha256:059b0bb7a4f485eb931a136af647e9eb5296bef0629fbf5cc2166a043029a3bd","observation_id":"c698fb39-f359-4ccf-bc76-66c16fef678f","resolution":{"observed_at":"2026-05-11T19:31:09.476633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2604.23338","last_updated":"2026-05-06T17:17:02Z","snapshot_observed_at":"2026-08-06T19:46:39.219000Z","submitted_at":"2026-04-25T14:57:15Z","title":"A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents: A Layered Attack Surface Framework","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T07:53:13.746141Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2604.23338"},"observation_digest":"sha256:559714994826f62e5c04cf27f305f4357ea9315112a6b07c0b4c6151d4e81cf8","observation_id":"63e4218e-7582-4fa1-9f5b-30946ea95025","resolution":{"observed_at":"2026-05-11T20:51:09.567702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2605.00123","last_updated":"2026-08-07T03:19:51Z","snapshot_observed_at":"2026-08-12T15:09:36.003888Z","submitted_at":"2026-04-30T18:22:19Z","title":"Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T20:39:39.225898Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2605.00123"},"observation_digest":"sha256:7a844134f4b21f38e0a66a7415b6aa52930915186ca964f6714e780274c2162e","observation_id":"5d7afb9e-d275-447f-9f23-c01aedbff02b","resolution":{"observed_at":"2026-05-11T15:01:09.629032Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2605.08496","last_updated":"2026-05-08T21:21:59Z","snapshot_observed_at":"2026-08-10T23:15:06.352977Z","submitted_at":"2026-05-08T21:21:59Z","title":"Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:49.586630Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2605.08496"},"observation_digest":"sha256:dfa0e1905c524cec644220bfb85c2e67388ff7384ac8fce85f83f3a16399870a","observation_id":"598a05e0-a41c-42a9-858b-69653353566e","resolution":{"observed_at":"2026-05-12T07:51:43.987363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2605.16551","last_updated":"2026-06-08T17:56:23Z","snapshot_observed_at":"2026-07-31T17:39:46.872890Z","submitted_at":"2026-05-15T18:50:43Z","title":"PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-20T18:03:07.646917Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2605.16551"},"observation_digest":"sha256:374f6f636ad16ce6dcd608abc22a9d961e5b77215a4d161970ef9f272b460d39","observation_id":"833c9c08-b805-4c2d-828c-8bd4f095fd6c","resolution":{"observed_at":"2026-05-20T18:03:36.763330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:118426bc496459dd3a4126fc739ce66e6f97f419a84f5911dd8b1e78363b8726","observation_id":"c766b4e8-3c80-4acc-acc4-12cc8b8205e3","resolution":{"observed_at":"2026-06-29T17:53:47.699039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2606.01738","last_updated":"2026-06-01T06:02:15Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T06:02:15Z","title":"THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T15:05:31.392966Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2606.01738"},"observation_digest":"sha256:a9d70e425f8d97b3fbd79368824d57399c767dcc27a4be43de34654420538f60","observation_id":"440422c9-2f00-4359-a058-80339a4cc457","resolution":{"observed_at":"2026-07-01T22:46:19.173126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2606.05609","last_updated":"2026-06-04T02:31:29Z","snapshot_observed_at":"2026-08-05T14:48:48.513078Z","submitted_at":"2026-06-04T02:31:29Z","title":"SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T01:16:07.252429Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2606.05609"},"observation_digest":"sha256:55a1a00388cba149f93c96aa847a80b153f9de6efbf75fbc763745b9ed64f1e6","observation_id":"0806e1bd-bc88-4890-a644-04a84df5052a","resolution":{"observed_at":"2026-07-02T13:26:59.309811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2606.19660","last_updated":"2026-06-17T23:59:57Z","snapshot_observed_at":"2026-08-08T17:16:02.859263Z","submitted_at":"2026-06-17T23:59:57Z","title":"A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:00:14.036515Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2606.19660"},"observation_digest":"sha256:6d33b621d8438bd431e6a9944c5a5cd0696eec4935ab18fd87607a477c5db841","observation_id":"7ad5939a-73f8-40b2-993c-5fe2b2a0181f","resolution":{"observed_at":"2026-07-04T02:09:22.521177Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2606.22237","last_updated":"2026-06-20T21:37:12Z","snapshot_observed_at":"2026-08-06T06:38:36.041719Z","submitted_at":"2026-06-20T21:37:12Z","title":"Investigating The Security of Modern AI and Cloud Infrastructure","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-06-26T11:31:39.910784Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2606.22237"},"observation_digest":"sha256:4e59c090777a7af64e73828be384eaeb4e906f156184de658e1f38453dd90359","observation_id":"89595de1-b9ad-4080-a147-1ed5fd276557","resolution":{"observed_at":"2026-07-04T08:29:42.325046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2606.27981","last_updated":"2026-06-26T11:30:42Z","snapshot_observed_at":"2026-07-07T00:02:09.217954Z","submitted_at":"2026-06-26T11:30:42Z","title":"ToxiREX: A Dataset on Toxic REasoning in ConteXt","version":1},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-06-29T04:33:18.794505Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2606.27981"},"observation_digest":"sha256:d0dd7db7a930c5a774c6251c187704ab6d4abb6b8100256459715da35bd7230e","observation_id":"e938f8b3-7d40-4f1f-9857-d41e30c67f32","resolution":{"observed_at":"2026-06-29T04:43:07.121701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-07-12T14:28:50.627444Z","title":"arXiv preprint arXiv:2310.06387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05407","last_updated":"2026-06-09T03:22:53Z","snapshot_observed_at":"2026-08-07T08:54:21.406314Z","submitted_at":"2026-06-09T03:22:53Z","title":"Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-07-12T14:28:50.627444Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2607.05407"},"observation_digest":"sha256:efe570b1963b87e22e89defbee402d60b305f22338d4add8f1bb0c3e72962f53","observation_id":"ccf75546-7565-452c-b4bb-2286973270ba","resolution":{"observed_at":"2026-07-12T14:28:50.627444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2607.07461","last_updated":"2026-07-08T14:29:23Z","snapshot_observed_at":"2026-08-08T05:41:46.659709Z","submitted_at":"2026-07-08T14:29:23Z","title":"Mitigating Taint-Style Vulnerabilities in MCP Servers via Security-Aware Tool Descriptions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T10:22:23.782469Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2607.07461"},"observation_digest":"sha256:95e77d4dfd24c16ceeb704803156a0484806580f76b2dab48dc83272d4b49d63","observation_id":"121b3da8-53a6-49bf-a5ae-cf67e5e61b74","resolution":{"observed_at":"2026-07-09T10:26:11.097166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-01T18:55:01.084617Z","title":"arXiv preprint arXiv:2310.06387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:01.084617Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:d560c1c8685609384ee0578c77705ad0cc3734ee8ebdc1bfda4970291c7b829c","observation_id":"dde8f715-429a-4a7b-a486-671e594e1b93","resolution":{"observed_at":"2026-08-01T18:55:01.084617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-07-31T16:06:05.960205Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24392","last_updated":"2026-07-27T13:07:52Z","snapshot_observed_at":"2026-08-07T21:49:09.749932Z","submitted_at":"2026-07-27T13:07:52Z","title":"When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T16:06:05.960205Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2607.24392"},"observation_digest":"sha256:00deb527849d523f4d616ec523677ff8b1cbce01f8143bbca1dae806cd5775ad","observation_id":"7a179e9a-bb3b-445a-b683-f7a1f9e23786","resolution":{"observed_at":"2026-07-31T16:06:05.960205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.06387/citation-record","integrity":"/paper/2310.06387/integrity","json":"/paper/2310.06387/citation-record.json","paper":"/paper/2310.06387"},"outbound":[],"paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 80 inbound Pith citation observations for arXiv:2310.06387."}