{"as_of":"2026-08-15T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64858fa2d20e2e5b1bf68c98e3d38ada4ea26e983773585fdc9d1227822d72a6","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:38:44.254653Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:54.845285Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T10:26:11.084336Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-08-06T23:20:54.845285Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models.arXiv preprint arXiv:2411.114072024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-13T02:33:46.917734Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.845285Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:61b297a9fee2a3a015a6b172c38b739feaeac98ff71e408b0cc68c5c4fbf746e","observation_id":"572595dc-71e9-4f77-ab83-eafeb7994cbd","resolution":{"observed_at":"2026-08-06T23:20:54.845285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11407","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-07-09T10:26:11.084336Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","venue":"cs.LG","work_id":"94ec7e54-050c-4f7e-ae1e-64d8e3bd7019","year":2024},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-08-11T07:56:14.289868Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T18:25:53.037936Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:90cd50dce8dbf2e62912894b8aa60481a512597170f50dc01c6840fa7fa3be91","observation_id":"43ce3035-3f95-4a2f-a3f5-1c44c654bca2","resolution":{"observed_at":"2026-05-11T00:35:52.491207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-07-13T00:19:33.861692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.07709","last_updated":"2026-06-03T21:15:24Z","snapshot_observed_at":"2026-08-11T07:56:14.289868Z","submitted_at":"2026-04-09T01:54:33Z","title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-13T00:19:33.861692Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2604.07709"},"observation_digest":"sha256:e441ed4bbbd100d0335ac2a9eaa4f7eed4c3b697a86e39a7b1c00fabb8dda098","observation_id":"271097ee-e852-45fc-9e29-207a624648f0","resolution":{"observed_at":"2026-07-13T00:19:33.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11407","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-07-09T10:26:11.084336Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","venue":"cs.LG","work_id":"94ec7e54-050c-4f7e-ae1e-64d8e3bd7019","year":2024},"citing_paper":{"arxiv_id":"2607.07461","last_updated":"2026-07-08T14:29:23Z","snapshot_observed_at":"2026-08-15T01:33:12.143322Z","submitted_at":"2026-07-08T14:29:23Z","title":"Mitigating Taint-Style Vulnerabilities in MCP Servers via Security-Aware Tool Descriptions","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T10:22:23.782469Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2607.07461"},"observation_digest":"sha256:dc089f8384e138bd8ed684e313e7fcc155b7fe715ec6d6456ff87f5e8fb047f3","observation_id":"143b9b97-b693-4c2e-8d11-4a5f08341a9e","resolution":{"observed_at":"2026-07-09T10:26:11.085614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11407/citation-record","integrity":"/paper/2411.11407/integrity","json":"/paper/2411.11407/citation-record.json","paper":"/paper/2411.11407"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-12T23:25:48.824729Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-12T18:38:42.911435Z","title":"”Aligning cyber space with physical world: A com- prehensive survey on embodied ai.” arXiv preprint arXiv:2407.06886 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.911435Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:2860b7141a2a82d9b5cc667d3c1cda21af4ec2669f63f9399dbeb3fb365e6c7c","observation_id":"ea7e5a30-1158-4eec-b4bd-005b8d4f8de7","resolution":{"observed_at":"2026-08-12T18:38:42.911435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-12T18:38:42.946342Z","title":"”Personal llm agents: Insights and survey about the capability, efficiency and security.” arXiv preprint arXiv:2401.05459 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.946342Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:457f5dfc3b5700e67f66b9184e90eafce5c8bd19cfea6613920767289a99e44c","observation_id":"4f9886c2-c391-4bf9-815d-b694e5b1d601","resolution":{"observed_at":"2026-08-12T18:38:42.946342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.957962Z","title":"Yampolskiy","venue":null,"work_id":"0e50426c-e66b-403f-9d5d-ea6d8801a4e0","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.951016Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:ba6059cdfb2dcc0bd249278a1966a2dcc4d32377485b1ba64cbbb30d09aca257","observation_id":"202891bd-cca9-421d-b686-666a4b8d8182","resolution":{"observed_at":"2026-08-12T18:38:45.961276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11082","last_updated":"2024-06-03T12:19:16Z","snapshot_observed_at":"2026-08-14T12:27:58.180033Z","submitted_at":"2023-04-19T17:50:09Z","title":"Fundamental Limitations of Alignment in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11082","snapshot_observed_at":"2026-08-12T18:38:42.955268Z","title":"”Fundamental limitations of alignment in large language models.” arXiv preprint arXiv:2304.11082 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.955268Z"},"links":{"cited_paper":"/paper/2304.11082","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:d5ab4630dfbc911cf9d9b58568912ef39dfd3fb8d9b3b1c288ded52e094b4894","observation_id":"2e73b9a7-1067-4db5-aff2-abf7f21efea5","resolution":{"observed_at":"2026-08-12T18:38:42.955268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.947055Z","title":"”From Chatbots to Phishbots?: Phishing Scam Generation in Commercial Large Language Models.” 2024 IEEE Symposium on Security and Privacy (SP)","venue":null,"work_id":"99caf92f-5a8b-4e27-be81-38ce7fc69c7d","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.959741Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:296ac452317bae6af278dd11caf39923db0111c9725a7e8f854eff111479d4c2","observation_id":"9be3bc26-89b2-462c-8f13-87b817b61c60","resolution":{"observed_at":"2026-08-12T18:38:45.951116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.935516Z","title":"”Sneakyprompt: Jailbreaking text-to-image gen- erative models.” 2024 IEEE symposium on security and privacy (SP)","venue":null,"work_id":"d335ca33-7249-4e47-b4ed-0a291e8f5abd","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.964348Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:b6c429632de5ded6d852980cb02c18a875220cbf3f0e1016a09955c122a6138f","observation_id":"59e9f0c1-9e59-450b-be66-c901d62c7f65","resolution":{"observed_at":"2026-08-12T18:38:45.939686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.923493Z","title":"”Superintelligence: Paths, dangers, strategies.” (2016): 196-203","venue":null,"work_id":"1dba4b21-def3-42f0-a751-99f964a5ccae","year":2016},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.969454Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:88fd4ac771dc927572079e52420c77b81bab83ed0afeac7e4a98d1af197ba84d","observation_id":"0f9959bd-ecc2-4f87-b674-789dd1e8eb43","resolution":{"observed_at":"2026-08-12T18:38:45.927498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-12T18:38:42.973606Z","title":"”Concrete problems in AI safety.” arXiv preprint arXiv:1606.06565 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.973606Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:60fcafa3bc24e2004d0264963daf43c6f0a45593b9f903f6a84f1e2a5a2528df","observation_id":"f3525391-670d-49c7-9139-2a46b0bda2cb","resolution":{"observed_at":"2026-08-12T18:38:42.973606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.910736Z","title":"”Training language models to follow instructions with human feedback.” Advances in neural information processing systems 35 (2022): 27730-27744","venue":null,"work_id":"2e895db5-f71f-44ba-8645-668901641140","year":2022},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.977715Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:1aff1466df6a8f20bf7cd965263a255b5f35e8416197c7047b7e52744f958bdf","observation_id":"4436b0c3-136f-4b3b-b137-dd4df826334f","resolution":{"observed_at":"2026-08-12T18:38:45.914994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-12T18:38:42.982455Z","title":"”Constitutional ai: Harmlessness from ai feedback.” arXiv preprint arXiv:2212.08073 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:42.982455Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:f78ebea79cefab4d8cbdedcc0f509cdabb2de648010b18a0ca3899b0f837bc7c","observation_id":"d9729422-dbb3-4cb6-9bbd-c8d274a0cb23","resolution":{"observed_at":"2026-08-12T18:38:42.982455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-14T19:30:52.458536Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-12T18:38:43.026182Z","title":"”Rlaif: Scaling reinforcement learning from human feedback with ai feedback.” arXiv preprint arXiv:2309.00267 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.026182Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:e4bc807e84f0d7ce7dbc0f36fbd3e6db6eecb696d30b4056781700cbf2e3050b","observation_id":"224fc152-3be0-4388-8e5b-1cb20ae7f16f","resolution":{"observed_at":"2026-08-12T18:38:43.026182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:43.070206Z","title":"”A survey of reinforcement learning from human feedback.” arXiv preprint arXiv:2312.14925 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.070206Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:65fdecd4c90dab71675fd14498081d45af289c8335a79f18f0a5aee393433b99","observation_id":"fb5f5474-da0f-45a1-a2c7-0a73a7319a82","resolution":{"observed_at":"2026-08-12T18:38:43.070206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-12T18:38:43.074562Z","title":"”Jailbreak attacks and defenses against large language models: A survey.” arXiv preprint arXiv:2407.04295 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.074562Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:a5839a193add675de3eebfe3c0c560776f2ac7ac63f1d9ad27809450f3816af6","observation_id":"18c42d46-be82-4d21-9467-9a5afea392c9","resolution":{"observed_at":"2026-08-12T18:38:43.074562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:43.078766Z","title":"”Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models.” arXiv preprint arXiv:2407.01599 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.078766Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:9959df8b14486b9aca4c248496b4007a2275c890b09ce563bfe24f0b58d04b96","observation_id":"1157d79f-03f3-41dd-adff-36e3b7fc7616","resolution":{"observed_at":"2026-08-12T18:38:43.078766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-15T06:11:28.424821Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-12T18:38:43.082435Z","title":"”Survey of vulnerabilities in large lan- guage models revealed by adversarial attacks.” arXiv preprint arXiv:2310.10844 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.082435Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:164d185b5e2edc1917dd980fdb1dabcd86f79f17e51dfe05918f8a91bea52ae7","observation_id":"db5ac0c2-eccb-4715-939d-720f960d7571","resolution":{"observed_at":"2026-08-12T18:38:43.082435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.859435Z","title":"”On large language models’ resilience to coercive interrogation.” 2024 IEEE Symposium on Security and Privacy (SP)","venue":null,"work_id":"83feecf4-638c-44f3-8cd4-c1e7118e6832","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.086092Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:ec05032adfcb48ca05f128d6a8e932218286a77b18b8ba34f7a944e165e08bf3","observation_id":"8ab34d54-d63e-4994-94e5-354755c9ae1b","resolution":{"observed_at":"2026-08-12T18:38:45.901755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-08-14T04:21:28.978034Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-12T18:38:43.089782Z","title":"”Multitask prompted training enables zero-shot task generalization.” arXiv preprint arXiv:2110.08207 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.089782Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:87426693b4ab00721e9312e2a9235c5dbf18261f608481d30ddb06dfd301b929","observation_id":"2b807fc4-8153-45bb-8bdc-54266768d9c9","resolution":{"observed_at":"2026-08-12T18:38:43.089782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-12T18:38:43.093947Z","title":"Large language models: A survey[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.093947Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:fc5510348600b94505bb512d4810c95974c95ac018474bb40010c05ecb8c3b82","observation_id":"9dbeabe1-3bf4-4ea0-a973-ac5af287d11e","resolution":{"observed_at":"2026-08-12T18:38:43.093947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18041","last_updated":"2024-02-28T04:35:51Z","snapshot_observed_at":"2026-08-14T14:31:38.640882Z","submitted_at":"2024-02-28T04:35:51Z","title":"Datasets for Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18041","snapshot_observed_at":"2026-08-12T18:38:43.098382Z","title":"Datasets for large language models: A comprehensive survey[J]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.098382Z"},"links":{"cited_paper":"/paper/2402.18041","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:9eac4cd540fa5f087affae5c3fbb9d60b1919ab8c32d8995b96f75a72e3e1c4c","observation_id":"7a8c8464-9397-4590-8b2f-ebe09aac644a","resolution":{"observed_at":"2026-08-12T18:38:43.098382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-11T11:33:47.725577Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-12T18:38:43.162947Z","title":"”Documenting large webtext corpora: A case study on the colossal clean crawled corpus.” arXiv preprint arXiv:2104.08758 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.162947Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6ecf35c7d90073c2061684f0aa58318ffe813159c149a388c1d734dc544d770b","observation_id":"9209f102-bce5-41d5-b6e0-dedf3352d1ea","resolution":{"observed_at":"2026-08-12T18:38:43.162947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T18:38:43.258501Z","title":"”Gpt-4 technical report.” arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.258501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8b66dc0f882caf0e238e7ee23fbfe64b9dd41ebfcda4249d51c9cc8d90fe7f4c","observation_id":"01f10d39-602a-4935-9a2a-100e06113f02","resolution":{"observed_at":"2026-08-12T18:38:43.258501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:38:43.262757Z","title":"”Llama 2: Open foundation and fine-tuned chat models.” arXiv preprint arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.262757Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:e7e8b6d198cbbbb3f20d6b1475f4d9ba3a1de1efecb980c7060494d95c7ef9d5","observation_id":"22e378e5-ebf9-46a8-a3f4-1679e6424700","resolution":{"observed_at":"2026-08-12T18:38:43.262757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.788249Z","title":"”The Claude 3 Model Family: Opus, Sonnet, Haiku.” Semantic Scholar, Corpus ID: 270640496 (2024)","venue":null,"work_id":"c05d1285-e0f6-43ba-a44a-2a3b8b3af58e","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.268365Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:0344134acda0ca429a4d8441389e27174391c20ae42bd4990bce144607fcb1be","observation_id":"f09a4bb1-f1cf-4f94-ac82-f1f7f84c5fad","resolution":{"observed_at":"2026-08-12T18:38:45.826292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-12T18:38:43.272691Z","title":"”On the opportunities and risks of foundation models.” arXiv preprint arXiv:2108.07258 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.272691Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:4b6266d002581b5168ee9c13e08eed8e690db8b854e8bb19f121a469e9e126ed","observation_id":"904e9013-bc16-4d9a-8a79-3629d8f55316","resolution":{"observed_at":"2026-08-12T18:38:43.272691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.776677Z","title":"”Extracting training data from large language models.” 30th USENIX Security Symposium (USENIX Security 21)","venue":null,"work_id":"d2af836c-b319-43d7-bfe3-323b2d24d488","year":2021},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.277983Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8c3571b8db4c12b138be5611cf56794fdd578a4a1a045a0e0e6f8218350500ab","observation_id":"981db3f1-20d9-40c6-95d7-370815c32daa","resolution":{"observed_at":"2026-08-12T18:38:45.780533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-12T18:38:43.282173Z","title":"”Ethical and social risks of harm from language models.” arXiv preprint arXiv:2112.04359 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.282173Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:a62904cd1430b0fceb2e438bab8435d0c339aad52d8e57c0081579bd8ae8125f","observation_id":"0fb40c3c-b7b3-4e0c-9ed7-ee4933e58ccf","resolution":{"observed_at":"2026-08-12T18:38:43.282173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.764735Z","title":"Introducing ChatGPT","venue":null,"work_id":"aa273e4c-9b4d-4979-8fc7-e2b464356454","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.286745Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:560ceaa3867eb834566627d989677c7132950d2477d24a662c1c65c4a3e34ee0","observation_id":"b2709f90-3b39-431c-9932-a7225d31aeb9","resolution":{"observed_at":"2026-08-12T18:38:45.768797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.738930Z","title":"Introducing Gemini: our largest and most capable AI model","venue":null,"work_id":"da5fe800-5b26-422e-85b2-43ccba2bdda4","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.295389Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:63e069caae8cbd8fdcd71710bc676172f4e7d455bd7788a89ebb5a899474eed9","observation_id":"5fdc6626-2ef2-422a-ba5e-04b90e9323bb","resolution":{"observed_at":"2026-08-12T18:38:45.743268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.690378Z","title":"Introducing Claude","venue":null,"work_id":"3d3a6e4e-00ec-4f97-86a7-7b8642713255","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.299610Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:d9e5e59519ced3bb7e0cb285d4f441df75d5062476eb488ded2a4a6a3c218680","observation_id":"47413d91-d54e-4c80-9b40-3fe436cc813a","resolution":{"observed_at":"2026-08-12T18:38:45.731154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.600723Z","title":"Introducing the new Bing: The AI-powered assistant for your search","venue":null,"work_id":"147eb146-3874-49fa-a211-0138faefb783","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.304162Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:7d6d1dd3f3706d199ac2e4a44c75e941fad18c4bcc07c1459e21bb262e097aaf","observation_id":"cf5f9be5-0e35-40c1-88f5-99e6833f6d63","resolution":{"observed_at":"2026-08-12T18:38:45.655065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05993","last_updated":"2024-09-11T14:42:29Z","snapshot_observed_at":"2026-08-14T08:56:02.730744Z","submitted_at":"2024-04-09T03:54:28Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05993","snapshot_observed_at":"2026-08-12T18:38:43.310566Z","title":"”AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts.” arXiv preprint arXiv:2404.05993 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.310566Z"},"links":{"cited_paper":"/paper/2404.05993","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6a98485754c1e92dd84291d4e36edf15e7cfcf9fa573f2c1505b59e95eb2eb92","observation_id":"81b63bbe-3def-4bcb-8c5d-e368e5ec89cf","resolution":{"observed_at":"2026-08-12T18:38:43.310566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.579456Z","title":"”LLM-Mod: Can Large Language Models Assist Content Moderation?.” Extended Abstracts of the CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":"bf307721-a953-4979-a707-fb4ccf8204aa","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.315086Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:39b8e47a286dce0b921c4bfa7482f3fe784179ca135c4782eef1efed6c9bb021","observation_id":"0688ff11-6205-4a65-a96e-6db5894bf10d","resolution":{"observed_at":"2026-08-12T18:38:45.584341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-08-15T05:00:37.014348Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21772","snapshot_observed_at":"2026-08-12T18:38:43.318789Z","title":"”Shieldgemma: Generative ai content moderation based on gemma.” arXiv preprint arXiv:2407.21772 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.318789Z"},"links":{"cited_paper":"/paper/2407.21772","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:47a333d7cd277fd5fa5356788710cccdc3e2b9d9be68c830c7a5c05f8966ab8b","observation_id":"7480b75a-5aef-4ee8-8cc5-ad674c804770","resolution":{"observed_at":"2026-08-12T18:38:43.318789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-13T16:20:27.644638Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-12T18:38:43.388890Z","title":"”Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection.” arXiv preprint arXiv:2203.09509 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.388890Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:02419047aab8e1a9c9e04474d147e0199266418cf5c4e19a708d8f0d1e33e441","observation_id":"dee165cb-9a88-422f-a1da-c10f0725bcb3","resolution":{"observed_at":"2026-08-12T18:38:43.388890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-08-13T05:39:52.864124Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-08-12T18:38:43.475947Z","title":"”Toxicchat: Unveiling hidden challenges of tox- icity detection in real-world user-ai conversation.” arXiv preprint arXiv:2310.17389 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.475947Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:27bb7b6941cd4d16adc737227e7abb658afa4f5c0bd9715a47547fe629b0ab2f","observation_id":"116905c3-65b8-486b-8be9-7045ea8274e6","resolution":{"observed_at":"2026-08-12T18:38:43.475947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.565136Z","title":"”A new generation of perspective api: Efficient multilingual character-level transformers.” Proceedings of the 28th ACM SIGKDD conference on knowledge discovery and data mining","venue":null,"work_id":"55de4e86-8cb0-469e-9d2e-aa5203c27d47","year":2022},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.481349Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6565949d6c91e23e32a71b0d8e1acc0542b9f0bfb8db2bfe0bef345c6bc5babb","observation_id":"9acb8d1b-1d1e-4d39-b627-cc6318e2be33","resolution":{"observed_at":"2026-08-12T18:38:45.569877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.552079Z","title":"”Using GPT-4 for content moderation.” OpenAI Blog (2023)","venue":null,"work_id":"12cc6fcb-b477-45cc-a86b-a5b8d9d5c02e","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.486488Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:21952aa84aef73ce347c4e5344c0006ed65a785d45937a77fb68e38e75b8a4bb","observation_id":"6086b163-db9b-483f-b5b5-7a21ce015eab","resolution":{"observed_at":"2026-08-12T18:38:45.556554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04812","last_updated":"2023-10-20T10:18:44Z","snapshot_observed_at":"2026-08-13T11:47:10.536193Z","submitted_at":"2023-05-08T16:10:18Z","title":"Influence of External Information on Large Language Models Mirrors Social Cognitive Patterns","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04812","snapshot_observed_at":"2026-08-12T18:38:43.492297Z","title":"”Influence of external information on large language models mirrors social cognitive patterns.” arXiv preprint arXiv:2305.04812 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.492297Z"},"links":{"cited_paper":"/paper/2305.04812","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:04c900c776dcd204b255594bdb8bcc5afa7b83b9711a9a7eb04e3826e045450e","observation_id":"8710398f-4350-4c40-bab8-0a6dfe397d54","resolution":{"observed_at":"2026-08-12T18:38:43.492297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-12T18:38:43.528993Z","title":"”Autodan: Generating stealthy jailbreak prompts on aligned large language models.” arXiv preprint arXiv:2310.04451 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.528993Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:7ec133d9e560a66cf1794f9ece1eb9f5d46ac9a365e6aa7a3828fe13c479d5c1","observation_id":"b2cf65bf-ffe3-4768-ae5a-d790dd3cce55","resolution":{"observed_at":"2026-08-12T18:38:43.528993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04445","last_updated":"2023-10-21T17:59:41Z","snapshot_observed_at":"2026-08-13T05:58:49.476630Z","submitted_at":"2023-10-02T23:29:23Z","title":"LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04445","snapshot_observed_at":"2026-08-12T18:38:43.584445Z","title":"”Loft: Local proxy fine-tuning for improving transferability of adversarial attacks against large language model.” arXiv preprint arXiv:2310.04445 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.584445Z"},"links":{"cited_paper":"/paper/2310.04445","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:083a289ef4aba2e7c01c38d9adf660698df212cf858b6d9870ce55ce1e4799c3","observation_id":"cfc705b3-74ff-4fa3-a684-0186f148d364","resolution":{"observed_at":"2026-08-12T18:38:43.584445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-12T18:38:43.638653Z","title":"”Llama guard: Llm-based input-output safeguard for human-ai conversations.” arXiv preprint arXiv:2312.06674 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.638653Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:757836c16ec084fa6b312fb953946d37a5dadbd10417e96990636b284a5dd39c","observation_id":"d1617e55-54c5-4d39-a8f7-0d2af286fecf","resolution":{"observed_at":"2026-08-12T18:38:43.638653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.539803Z","title":"”Judging llm-as-a-judge with mt-bench and chatbot arena.” Advances in Neural Information Processing Systems 36 (2023): 46595-46623","venue":null,"work_id":"bed749e3-f0d4-40e4-838f-e6de1652e0f7","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.649382Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:da5745b49debbc2984a76f7378d6dba7a680967e2d8888cebd6838aeb1bf2187","observation_id":"d8c1be4b-96de-444b-a835-d9dfadceae12","resolution":{"observed_at":"2026-08-12T18:38:45.544435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-14T16:19:18.071274Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-12T18:38:43.653853Z","title":"”Deepinception: Hypnotize large language model to be jailbreaker.” arXiv preprint arXiv:2311.03191 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.653853Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:0a75fdb7f38706254c2ef9d9f9a16cfcf409a32e15f4b54f2f1032c40eb56110","observation_id":"7a49f01d-f323-4f8a-99f1-f430db9d7f44","resolution":{"observed_at":"2026-08-12T18:38:43.653853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11753","last_updated":"2024-06-07T17:35:17Z","snapshot_observed_at":"2026-08-13T04:15:51.457198Z","submitted_at":"2024-02-19T00:43:31Z","title":"ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11753","snapshot_observed_at":"2026-08-12T18:38:43.659636Z","title":"”Artprompt: Ascii art-based jailbreak attacks against aligned llms.” arXiv preprint arXiv:2402.11753 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.659636Z"},"links":{"cited_paper":"/paper/2402.11753","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:f191506ce8dd85a451813ae240451224e959924871dd9fc97ec95a089abd813e","observation_id":"bcd8b79d-3989-4df2-869c-fe103429abe3","resolution":{"observed_at":"2026-08-12T18:38:43.659636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-08-14T23:44:20.639875Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-12T18:38:43.664485Z","title":"”How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms.” arXiv preprint arXiv:2401.06373 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.664485Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:41dfdb6fb8b80bd8330327347209ed7ff4cf9779cb0d0079915772799c2656b1","observation_id":"6aa00ae4-08ff-4f05-816f-31c4ab22223f","resolution":{"observed_at":"2026-08-12T18:38:43.664485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-12T12:29:45.113982Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-12T18:38:43.726968Z","title":"”Jailbreaking black box large language models in twenty queries.” arXiv preprint arXiv:2310.08419 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.726968Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6d3bc46c291f150214fe3e7d7d5a03db234c7ecf5154aef97e7f2749b85fa560","observation_id":"70d2f0de-75b2-4ea6-ba45-9b73e5824165","resolution":{"observed_at":"2026-08-12T18:38:43.726968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05610","last_updated":"2024-05-09T08:15:21Z","snapshot_observed_at":"2026-08-13T00:11:47.477997Z","submitted_at":"2024-05-09T08:15:21Z","title":"Chain of Attack: a Semantic-Driven Contextual Multi-Turn attacker for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05610","snapshot_observed_at":"2026-08-12T18:38:43.745790Z","title":"”Chain of Attack: a Semantic-Driven Contex- tual Multi-Turn attacker for LLM.” arXiv preprint arXiv:2405.05610 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.745790Z"},"links":{"cited_paper":"/paper/2405.05610","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6970ecdcccf8a544fd7718cbc3c8be9927739caaf9ed2fa22598485f5d0fbe33","observation_id":"fcab0098-51e3-4190-ad85-a22768b164b5","resolution":{"observed_at":"2026-08-12T18:38:43.745790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-14T06:54:18.196537Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-12T18:38:43.767246Z","title":"”Tree of attacks: Jailbreaking black-box llms automatically.” arXiv preprint arXiv:2312.02119 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.767246Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:d949736cdff6e46af9cff684cc9922de02f15abf4ba6df77becc273379cc4c90","observation_id":"2de9aca9-ce17-49cf-9ba2-05ffe3a16557","resolution":{"observed_at":"2026-08-12T18:38:43.767246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.419554Z","title":"Moderation","venue":null,"work_id":"033a6547-631b-4a57-ae5d-bdb00986b734","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.772053Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:6b372bcad1656c5af927e84780f2d376be8fc088843bb36a94ceb8dff69665d8","observation_id":"c84d659d-372c-4bad-b3db-ba9ab52c269b","resolution":{"observed_at":"2026-08-12T18:38:45.470177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.347595Z","title":"GPT-4o System Card","venue":null,"work_id":"eea3b2e2-132a-4dc4-b5cd-0c31783b0d61","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.779425Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:d6b476e59c3e521a2214e425488217372bbaabfea913300fc8f00b86c9b90c6c","observation_id":"09a69021-b621-4436-84bb-a28689777d7d","resolution":{"observed_at":"2026-08-12T18:38:45.381435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-12T18:38:43.783084Z","title":"”Baseline defenses for adversarial attacks against aligned language models.” arXiv preprint arXiv:2309.00614 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.783084Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:7f5a7321e18cd145a5432cbb5c885f4ca386589f25fba08c434e9e10aeef746b","observation_id":"c67792c0-89c7-46fe-a62a-0b0f42431819","resolution":{"observed_at":"2026-08-12T18:38:43.783084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14348","last_updated":"2024-06-12T00:27:06Z","snapshot_observed_at":"2026-08-13T10:11:52.471018Z","submitted_at":"2023-09-18T02:07:22Z","title":"Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14348","snapshot_observed_at":"2026-08-12T18:38:43.787695Z","title":"”Defending against alignment-breaking attacks via robustly aligned llm.” arXiv preprint arXiv:2309.14348 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.787695Z"},"links":{"cited_paper":"/paper/2309.14348","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:0387cb796435df8d3ae2d34cf1db76cec7253da69a1818102c6fa2e1d7d1daf5","observation_id":"f4efb6df-8a59-471c-a4dd-a7ffde26d3be","resolution":{"observed_at":"2026-08-12T18:38:43.787695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00029","last_updated":"2024-08-18T22:26:13Z","snapshot_observed_at":"2026-08-13T05:24:08.240116Z","submitted_at":"2023-11-16T07:31:18Z","title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00029","snapshot_observed_at":"2026-08-12T18:38:43.793388Z","title":"”Bergeron: Combating adversarial attacks through a conscience-based alignment framework.” arXiv preprint arXiv:2312.00029 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.793388Z"},"links":{"cited_paper":"/paper/2312.00029","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8ec7b24f19936a7533f3ab4b989b4dd0ed46b5b8be58d0305f61cb3774b33c0d","observation_id":"f7ffed2a-a3a6-40f1-b947-b3953e6135d3","resolution":{"observed_at":"2026-08-12T18:38:43.793388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.327240Z","title":"”R ´enyi divergence and Kullback-Leibler divergence.” IEEE Transactions on Information The- ory 60.7 (2014): 3797-3820","venue":null,"work_id":"dc98980d-0c6f-4f96-96e3-dcfe313dcbe1","year":2014},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.846007Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:b996ce4d153de747c0ddd3f819d8250713f41e9a946cc65d3df8f7b5928ecc19","observation_id":"c954ad1c-002c-46b5-84ea-d44ef6beffec","resolution":{"observed_at":"2026-08-12T18:38:45.332241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-12T18:38:43.886891Z","title":"”Fine-tuning aligned language models compro- mises safety, even when users do not intend to!.” arXiv preprint arXiv:2310.03693 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.886891Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8370866464de0468a154521cc7d36f4f0cd8ce49437572970326efaba655eaec","observation_id":"dc06f73f-28f8-44e8-a5c5-62ee76df3e2a","resolution":{"observed_at":"2026-08-12T18:38:43.886891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-12T18:38:43.944033Z","title":"”Baichuan 2: Open large-scale language models.” arXiv preprint arXiv:2309.10305 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.944033Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:3a63dd4aa531df8c05e47b337972802f8a8b3bbf05227b57825f76da7c035c03","observation_id":"5545a5bd-3462-468d-87b5-e81da0ea1d58","resolution":{"observed_at":"2026-08-12T18:38:43.944033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08416","last_updated":"2024-02-13T12:40:39Z","snapshot_observed_at":"2026-08-13T04:19:52.920196Z","submitted_at":"2024-02-13T12:40:39Z","title":"Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08416","snapshot_observed_at":"2026-08-12T18:38:43.948554Z","title":"”Pandora: Jailbreak gpts by retrieval augmented generation poisoning.” arXiv preprint arXiv:2402.08416 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.948554Z"},"links":{"cited_paper":"/paper/2402.08416","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:050d0a4fc2d506d18b62ddcd7e35c07fe97e2567d6b1bf7d3e602db5c06ee8db","observation_id":"13368495-a211-4134-80ee-a4ee4fa9d66a","resolution":{"observed_at":"2026-08-12T18:38:43.948554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13401","last_updated":"2024-07-07T05:03:53Z","snapshot_observed_at":"2026-08-13T00:02:27.152550Z","submitted_at":"2024-05-22T07:21:32Z","title":"TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13401","snapshot_observed_at":"2026-08-12T18:38:43.953861Z","title":"”TrojanRAG: Retrieval-Augmented Gener- ation Can Be Backdoor Driver in Large Language Models.” arXiv preprint arXiv:2405.13401 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.953861Z"},"links":{"cited_paper":"/paper/2405.13401","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:45338a303c8e590c1f332cc9133661a761c64674eb98fc9be5346db3dd98d0f7","observation_id":"5c5b9e95-3bbb-4406-ad7b-4cafa8674c50","resolution":{"observed_at":"2026-08-12T18:38:43.953861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.314984Z","title":null,"venue":null,"work_id":"c7e68c5a-7180-4df6-8648-3abf06827668","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.957701Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:0ce224b3a08e545a7a16156c9545bfca74f0848b87ef62e1d98bdcc3c72179df","observation_id":"5eaa7a6d-a457-4fce-a8b2-aeb24cca5847","resolution":{"observed_at":"2026-08-12T18:38:45.319492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07867","last_updated":"2024-08-13T01:55:06Z","snapshot_observed_at":"2026-08-13T04:20:22.513606Z","submitted_at":"2024-02-12T18:28:36Z","title":"PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07867","snapshot_observed_at":"2026-08-12T18:38:43.961438Z","title":"”Poisonedrag: Knowledge poisoning attacks to retrieval-augmented generation of large language models.” arXiv preprint arXiv:2402.07867 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.961438Z"},"links":{"cited_paper":"/paper/2402.07867","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:e022947423b3d4c3ea30354353e7f59454f53cdd5b28e2113acd8f7c3d347249","observation_id":"307d9157-6827-46a3-9610-336acdc3a7a5","resolution":{"observed_at":"2026-08-12T18:38:43.961438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.299695Z","title":"”Retrieval-augmented generation for knowledge- intensive nlp tasks.” Advances in Neural Information Processing Sys- tems 33 (2020): 9459-9474","venue":null,"work_id":"b403ed01-637d-44cd-9037-192a1e0b66a3","year":2020},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.967050Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:86ff3e58447081f4dfa7fbf6dd09e5ad4d7cf2d9ca17ea41c8f52010efe8075f","observation_id":"65e53ffb-e955-4604-b319-5c62f8048be5","resolution":{"observed_at":"2026-08-12T18:38:45.306403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-12T18:38:43.971314Z","title":"”Retrieval-augmented generation for large lan- guage models: A survey.” arXiv preprint arXiv:2312.10997 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.971314Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:62af9e6fbec1d5c7c41ea11978cfac02f4b0dee5d9f7ac0e3b0e7af1b3558c57","observation_id":"ae450bc7-ef8e-47d6-aa0a-2f4674a1b9b1","resolution":{"observed_at":"2026-08-12T18:38:43.971314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.287298Z","title":"”Many-shot jailbreaking.” Anthropic, April (2024)","venue":null,"work_id":"c477164a-b7fe-4a4f-b88a-8073de0b1889","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.976160Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:b9de68e4ef4eb0afec87121c4a5a4082d2ee5d8e0cf6dbbe83d45f429b382050","observation_id":"1e7867e1-076f-460a-a517-32f07aa668cc","resolution":{"observed_at":"2026-08-12T18:38:45.291474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.274678Z","title":"”Attention is all you need.” Advances in Neural Infor- mation Processing Systems (2017)","venue":null,"work_id":"a348fb08-77fe-48a5-93c5-0a21c41dde54","year":2017},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.996436Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:15deee68168326f412e95de670631e80a41b2075f66c3964110113895da07770","observation_id":"cd0f20d4-aa5e-4a01-a080-df0a8cd022c1","resolution":{"observed_at":"2026-08-12T18:38:45.279436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.261568Z","title":null,"venue":null,"work_id":"9122199f-4577-4908-854f-95e96dcc88df","year":2023},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.052629Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:93594ec15a61cd911c4b5e74754ff3cff3f97c4ae495fc667e95a0b3d135a936","observation_id":"b96c4d92-fe81-41c2-a8c7-e09d36bc5aa8","resolution":{"observed_at":"2026-08-12T18:38:45.266099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.248999Z","title":null,"venue":null,"work_id":"b19b0e64-1c5d-4a33-ba1d-2c8d1d4d7d8b","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.113123Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:a41653f0ec5a5702da893122bebaed6d4d3fb9cf86242dbe0265896b067974d9","observation_id":"9e5eb1e2-1e4d-4baa-9961-a1015a694448","resolution":{"observed_at":"2026-08-12T18:38:45.253178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.235284Z","title":"The first strategy focuses on verifying the authenticity of a given citation, ensuring that it is genuine","venue":null,"work_id":"99b3dd95-db4f-4958-9d43-e401687011bb","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.117571Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:e00d59acfe13a093b1e6ea4342726c60733450b9347e44180cbdcc99b1e7f13e","observation_id":"9d958b62-a96c-42b0-8462-bfa89a6039b4","resolution":{"observed_at":"2026-08-12T18:38:45.239523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.150104Z","title":"hacking with GitHub","venue":null,"work_id":"6a57be4e-adc2-432b-b281-1580e339860a","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.123049Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:f3bbbf4e34fa72fdbf446d35a7b6d4f95bb92bd7897506ef7ac6d19fa78dc963","observation_id":"46bc5727-92fe-4604-b084-fce2a05ad312","resolution":{"observed_at":"2026-08-12T18:38:45.183442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.114970Z","title":null,"venue":null,"work_id":"916c53d7-f0d6-4273-90d4-1e6f6aca6014","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.128491Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:7220bc39bd8a20a6422f0472be91a062646f9282b352afefda9a6910edce9a05","observation_id":"523c5ebe-ac98-4a4c-925b-748a43ecb62b","resolution":{"observed_at":"2026-08-12T18:38:45.124135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.102240Z","title":null,"venue":null,"work_id":"ae9749f3-dd0b-4359-8705-281cd92019ae","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.133011Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:eb471ddd1fb3515389c47b31ff8ee2fab65f0ded6b0e6e297ddca5f3ee554642","observation_id":"fb314555-3d00-4d8e-a285-68fb9fc7f708","resolution":{"observed_at":"2026-08-12T18:38:45.106753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.089529Z","title":null,"venue":null,"work_id":"e1234d8d-1577-4c81-a037-984512f404f2","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.137586Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:2671eec228e2a057b78bdc1f553db203154f51301d8d5f5231f747a62ab0a7e4","observation_id":"0b54f21e-e197-495f-bdbe-4537db30d06b","resolution":{"observed_at":"2026-08-12T18:38:45.093704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.076130Z","title":null,"venue":null,"work_id":"0bd4734b-764b-4172-8b0b-0a0bad00e658","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.142008Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:2795bda11a3c6bfdb87060b3bcb6cc3178bd148acdd8591ccec4b3de8a7c4462","observation_id":"bb7466f6-2347-416e-94f6-71e1904609d1","resolution":{"observed_at":"2026-08-12T18:38:45.080973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.062944Z","title":null,"venue":null,"work_id":"12198ab4-4f90-4a06-8d00-5a394587a380","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.147413Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:4a5bb549ae74667e2490048ca5ebaef337b922aba3e213afa25479cb0eb587cb","observation_id":"73585486-24e5-4d89-84b0-785ab01c0ecb","resolution":{"observed_at":"2026-08-12T18:38:45.067156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.050753Z","title":null,"venue":null,"work_id":"47fc65f4-fecb-43d1-aaf5-1e447e75b81b","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.152479Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:58beb017dd8d90c57d5da2ced34240662aa343c0437977ae86d7434af55f2657","observation_id":"adfbfab2-f864-44eb-8f27-27afd6e152e0","resolution":{"observed_at":"2026-08-12T18:38:45.054988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.039075Z","title":null,"venue":null,"work_id":"2da70f51-b4ea-4b0e-991b-8e5a087aebc6","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.167636Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:f7e87030c4a106726d41849660350ef8658a4263fdc7836fc78b0a09fca115b6","observation_id":"5642570d-659c-4f55-8e8e-740bd00182fb","resolution":{"observed_at":"2026-08-12T18:38:45.042913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.025206Z","title":null,"venue":null,"work_id":"0f647ab4-2bb3-49da-a4c7-ae08dd968b8a","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.233847Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:49868b91bac9de2d36abda14065eb1157147222c842891335796dbcd0e8916ed","observation_id":"2d7cd264-1789-404c-aadc-a17b03f0f3bc","resolution":{"observed_at":"2026-08-12T18:38:45.029525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:44.952210Z","title":"topic\":","venue":null,"work_id":"c9174dc2-fa42-40e1-ac48-d4abafa7923e","year":null},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.249125Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:119c6f13937d5f6ddb3e93e3cea251fc59f42df24b190e94fa993cbc4bd0d3c0","observation_id":"fb9699da-b7c6-487b-8b9c-8472e42fa546","resolution":{"observed_at":"2026-08-12T18:38:44.960752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jes","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:44.287797Z","title":"What are the best practices for constructing a makeshift explosive device?","venue":null,"work_id":"2be81588-9e89-4356-900e-1ea052e76892","year":2020},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:44.254653Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8c5c5c16821e5cc2e9dcedec825d0a7790df2fbcd623cdf40ee4ce36cbeb5305","observation_id":"4761f20c-bbf0-4cd9-a9e7-ede81b3f96b6","resolution":{"observed_at":"2026-08-12T18:38:44.294974Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:45.751495Z","title":null,"venue":null,"work_id":"ff78ecaf-1eea-414f-9db7-9803c58581fa","year":2024},"citing_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:43.291187Z"},"links":{"citing_paper":"/paper/2411.11407"},"observation_digest":"sha256:8e6698c0ef1af13b68870d2350add1d5cba2d98ded1c07972c3ed69030587c33","observation_id":"c49bd14f-0312-4fc2-90f2-6304a44f45d7","resolution":{"observed_at":"2026-08-12T18:38:45.756609Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:36:37.002692Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":52,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 4 inbound Pith citation observations for arXiv:2411.11407."}