{"as_of":"2026-08-12T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f5c64704684efc6a582c20c2b86f42b2b5f1dfffcc4de078195f425d412569d","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:05:18.310292Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:57.184523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-06T23:20:57.184523Z","title":"Droj: A prompt-driven attack against large language models.arXiv preprint arXiv:2411.091252024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.184523Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:f82d0ce2efae1acdb904ee0f7a1c627a4295e46591bedf283fa9ca5ad2fbb96c","observation_id":"4340b1d7-49c0-436b-84dc-94c912fa73fd","resolution":{"observed_at":"2026-08-06T23:20:57.184523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-05T16:00:48.525273Z","title":"Droj: A prompt-driven attack against large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.525273Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:923eaac92c3410243be063a21ae914e9f2ccb0a52f4dd7d763e20cf0b0a9adc2","observation_id":"a5be9d95-d140-4449-9c6f-9a341cc5624a","resolution":{"observed_at":"2026-08-05T16:00:48.525273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-04T17:46:19.316937Z","title":"DROJ: A prompt-driven attack against large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10682","last_updated":"2025-09-12T20:26:16Z","snapshot_observed_at":"2026-08-12T22:01:07.249587Z","submitted_at":"2025-09-12T20:26:16Z","title":"LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-04T17:46:19.316937Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2509.10682"},"observation_digest":"sha256:a1be453eded63fb81db5511b6dd16cf6929434afe4913c73698927255f5b2c7c","observation_id":"a308273d-44f2-4fa2-939c-cbd9a7e61673","resolution":{"observed_at":"2026-08-04T17:46:19.316937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-04T11:17:47.726898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05969","last_updated":"2026-07-19T06:24:18Z","snapshot_observed_at":"2026-08-10T15:34:13.761285Z","submitted_at":"2025-10-07T14:24:32Z","title":"Probing the Difficulty Perception Mechanism of Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:17:47.726898Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2510.05969"},"observation_digest":"sha256:5f88bbed8502c45c206da376ef2f4859fe11a7281b9563c99211701d9ca2d58e","observation_id":"dab38a09-c02a-471d-ac78-c674820b964f","resolution":{"observed_at":"2026-08-04T11:17:47.726898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.09125","doi":"10.48550/arxiv.2411.09125","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"894ecf05-8e69-400e-88e0-0586b0d2fdb7","year":2024},"citing_paper":{"arxiv_id":"2606.07539","last_updated":"2026-04-29T17:39:36Z","snapshot_observed_at":"2026-08-02T12:30:34.186010Z","submitted_at":"2026-04-29T17:39:36Z","title":"Prompt Governance? On Governing Technologies Governed by Natural Language","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-07-01T08:17:10.481202Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2606.07539"},"observation_digest":"sha256:c90c436a6972202218c22100b9162ec96f6fd18a27b417046e6087448a11817f","observation_id":"5c385afd-db4c-42fe-b7bf-baee5a6e493e","resolution":{"observed_at":"2026-07-01T08:25:32.683848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09125/citation-record","integrity":"/paper/2411.09125/integrity","json":"/paper/2411.09125/citation-record.json","paper":"/paper/2411.09125"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T21:05:18.248906Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.248906Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:c1b79de855ed6399e8f7acaeb6ccb4c178a7a48a868640fede37a3ccbd8626c9","observation_id":"84f5bb80-e193-458a-b6ad-37248f04cbf0","resolution":{"observed_at":"2026-08-12T21:05:18.248906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T21:05:18.257404Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.257404Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:6b1611eee2696cea7a466c7f5fb1297ccb14969d5013dc2a046f827166643574","observation_id":"499b9844-f69f-4404-bd0a-06424cd433fd","resolution":{"observed_at":"2026-08-12T21:05:18.257404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-12T21:05:18.272247Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.272247Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:49a2299086701fade49396c31be02dbf95e406e210422d7f5d560a8de20cd9cc","observation_id":"2b5f6412-8e9b-4feb-88ad-3adbe95040a8","resolution":{"observed_at":"2026-08-12T21:05:18.272247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-12T21:05:18.275605Z","title":"Baseline defenses for adversarial attacks against aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.275605Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:90259f17e3781d347e6136f4fa518d8ba870f5fb7ecf971e5f57718005f1a72a","observation_id":"97883a66-11dd-4ed0-9fe8-aef432d90b6c","resolution":{"observed_at":"2026-08-12T21:05:18.275605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T21:05:18.279196Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.279196Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:54c328cba0d2b94dc41fa3b7cfec82682dac2cbcdf5e46c980b9b2bdc7364640","observation_id":"55177f3b-2436-43cc-b623-78593b39ce49","resolution":{"observed_at":"2026-08-12T21:05:18.279196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-12T17:19:49.958976Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-12T21:05:18.282680Z","title":"Open sesame! universal black box jailbreaking of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.282680Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:e51ec57b009240e7c7cee744cd6946b700f73adc9ff0c8df767409f492fc6563","observation_id":"3748be3e-42c4-4602-8de9-3c06ec7fa0e9","resolution":{"observed_at":"2026-08-12T21:05:18.282680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-12T21:05:18.286093Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.286093Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:9abbe1e90147155e803cf4dd3ae8a6848c0482e05915b227be434ed8be5620a8","observation_id":"6d0b4eaa-7234-4610-8c9b-989234954785","resolution":{"observed_at":"2026-08-12T21:05:18.286093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16006","last_updated":"2024-06-04T02:59:58Z","snapshot_observed_at":"2026-08-11T05:45:09.524529Z","submitted_at":"2024-02-25T06:46:27Z","title":"ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16006","snapshot_observed_at":"2026-08-12T21:05:18.293243Z","title":"From noise to clarity: Unraveling the adver- sarial suffix of large language model attacks via translation of text embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.293243Z"},"links":{"cited_paper":"/paper/2402.16006","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:3781ec10741d0a7707bd702b43693fef7dbdb8dcc67aa1d9a901e1b1ef1ccc92","observation_id":"76410ec2-e056-4511-b470-3b16c89a2efb","resolution":{"observed_at":"2026-08-12T21:05:18.293243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-12T21:05:18.296806Z","title":"Finetuned language models are zero-shot learners.arXiv preprint arXiv:2109.01652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.296806Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:6f1e7c94f958fcdb87168c7e9f522882d201fa950759b91458f96c3f7e2fd20d","observation_id":"12eb1332-d419-40c4-bf66-1a17822cbae8","resolution":{"observed_at":"2026-08-12T21:05:18.296806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-12T21:05:18.300047Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.300047Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:409c1597056b9dc8197ee2cc1429412d7b881dc8b79096603495bd8fdd65d32b","observation_id":"6381b773-e8c9-48c4-92ef-f99986a5ad55","resolution":{"observed_at":"2026-08-12T21:05:18.300047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-12T21:05:18.303373Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.303373Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:d2117c1403b1d63175f5c8b5d937b13ba9460e36d8f28759320a85cdc5916b13","observation_id":"17bb32fe-3f83-446e-9564-6c6cd57c1830","resolution":{"observed_at":"2026-08-12T21:05:18.303373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-08-09T19:38:39.757845Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-12T21:05:18.306762Z","title":"Prompt-driven llm safeguarding via directed representation optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.306762Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:5ad731d2041de07961ee5b23f5bbc01a04f750bad165fb57901accde97647bd9","observation_id":"ba0aabf4-8c01-4579-94de-e61e0ca19bfa","resolution":{"observed_at":"2026-08-12T21:05:18.306762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-12T21:05:18.310292Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.310292Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:ab0a9319eb2afc9ea169b420fd987cbe43af6aaa6648f81e031c2eec3536cc0b","observation_id":"77a4ff95-2fe2-4112-9023-64d5aff29bb1","resolution":{"observed_at":"2026-08-12T21:05:18.310292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13733","last_updated":"2021-04-15T17:43:43Z","snapshot_observed_at":"2026-08-11T10:07:49.426481Z","submitted_at":"2021-04-15T17:43:43Z","title":"Gradient-based Adversarial Attacks against Text Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13733","snapshot_observed_at":"2026-08-12T21:05:18.264943Z","title":"Gradient-based adversarial attacks against text transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.264943Z"},"links":{"cited_paper":"/paper/2104.13733","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:e6be851f264f1bb91f210b5980f35e8a26b2299251e1037e07c9a1fb3c2fe60f","observation_id":"1b99365c-887d-447b-9138-53138c6114d3","resolution":{"observed_at":"2026-08-12T21:05:18.264943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07308","last_updated":"2024-05-02T14:28:39Z","snapshot_observed_at":"2026-08-10T17:53:09.843403Z","submitted_at":"2023-08-14T17:54:10Z","title":"LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07308","snapshot_observed_at":"2026-08-12T21:05:18.268644Z","title":"Llm self defense: By self examination, llms know they are being tricked","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.268644Z"},"links":{"cited_paper":"/paper/2308.07308","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:2fbde4d5bab35a4277fc07cdc808b3fb76353ee7b22b6fc4c9707146805cd271","observation_id":"243d5db0-569a-4077-b852-58297066fc7d","resolution":{"observed_at":"2026-08-12T21:05:18.268644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-12T21:05:18.289592Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.289592Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:f7c98418708a2764d6e88f060e3abaef4abf5c5b103bcf44a569d37d8303f9e0","observation_id":"7c429825-233c-474c-bd26-21d3cf617a2e","resolution":{"observed_at":"2026-08-12T21:05:18.289592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-12T21:05:18.253164Z","title":"Detecting language model attacks with perplexity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.253164Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:016c3244a3c2b7bd8795e1f3eb72f8e933e9d767f4bebfc08daed0173cd83872","observation_id":"cfaa11b8-3421-401a-adc5-b3e4c3b2b82f","resolution":{"observed_at":"2026-08-12T21:05:18.253164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T21:05:18.260954Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.260954Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:a40617cab5198ee154e4b133842ab3e8d6c85d5d3e69b0a4e464f11c8992d939","observation_id":"fca8b031-e28e-4df9-96ad-b4dd1afe537c","resolution":{"observed_at":"2026-08-12T21:05:18.260954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 5 inbound Pith citation observations for arXiv:2411.09125."}