{"as_of":"2026-08-21T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c6829a7d8b9a06d7fca043f3900f9a80e5d3596081b01b75354d0a308a253b8","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:07:54.305218Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:40:45.239429Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10838","snapshot_observed_at":"2026-08-04T09:40:45.239429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14207","last_updated":"2026-06-29T03:28:16Z","snapshot_observed_at":"2026-08-13T07:44:10.852942Z","submitted_at":"2025-10-16T01:27:44Z","title":"Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:40:45.239429Z"},"links":{"cited_paper":"/paper/2505.10838","citing_paper":"/paper/2510.14207"},"observation_digest":"sha256:443dcb0875137894064aa739cf1ca9574d191bdbf243e471948b87b8124e4c93","observation_id":"96604676-e465-415a-8d7b-14ad7da08157","resolution":{"observed_at":"2026-08-04T09:40:45.239429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"cited_work":{"arxiv_id":"2505.10838","doi":"10.48550/arxiv.2505.10838","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Largo: Latent adversarial reflection through gradient optimization for jailbreaking llms","venue":"ArXiv.org","work_id":"f549a26e-d636-430f-9580-9482f0cbbe09","year":2025},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-08-20T19:02:09.543322Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2505.10838","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:44a07d0ee3b9fc0589d43f51c8ddd96b9546be3465b4c7d905a0fa5364011ec6","observation_id":"3ac00727-fbd8-40b5-9a4f-c40f5e92ecdf","resolution":{"observed_at":"2026-05-14T20:17:56.372026Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"cited_work":{"arxiv_id":"2505.10838","doi":"10.48550/arxiv.2505.10838","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Largo: Latent adversarial reflection through gradient optimization for jailbreaking llms","venue":"ArXiv.org","work_id":"f549a26e-d636-430f-9580-9482f0cbbe09","year":2025},"citing_paper":{"arxiv_id":"2605.21362","last_updated":"2026-05-20T16:27:00Z","snapshot_observed_at":"2026-08-17T16:09:34.303359Z","submitted_at":"2026-05-20T16:27:00Z","title":"LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T04:48:19.926845Z"},"links":{"cited_paper":"/paper/2505.10838","citing_paper":"/paper/2605.21362"},"observation_digest":"sha256:9329c45d79135a09d1d05813eb84995f5ac1909e4ba76772d5f93856094bc175","observation_id":"3511bb0f-cefa-4b94-808f-cd4bb9419a47","resolution":{"observed_at":"2026-05-21T04:49:35.512077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10838/citation-record","integrity":"/paper/2505.10838/integrity","json":"/paper/2505.10838/citation-record.json","paper":"/paper/2505.10838"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T21:07:54.219516Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.219516Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:936573e07464a83083e8086b51e588b7a4940fbf3e1cade82ab1b8835754b49a","observation_id":"4886c8f0-3c39-4604-b996-ca36dc7c5c2a","resolution":{"observed_at":"2026-08-15T21:07:54.219516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-15T21:07:54.232733Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.232733Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:09c2867b7b7f8098fd12f9933125dd1c056b7d006deebaf6b6b0bdf8ee278906","observation_id":"fc74c2c6-b7e9-48bb-9577-8dd5e944dbde","resolution":{"observed_at":"2026-08-15T21:07:54.232733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-15T21:07:54.237043Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.237043Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:87d14546bcb9013cdd7969c74c4d651cc95edb05fd127a8508db5a047b2dc277","observation_id":"0558ed9f-d215-4fd7-88f2-9fa78cf01c43","resolution":{"observed_at":"2026-08-15T21:07:54.237043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04811","last_updated":"2025-03-25T01:51:22Z","snapshot_observed_at":"2026-08-18T19:01:00.096232Z","submitted_at":"2024-08-09T01:45:39Z","title":"h4rm3l: A language for Composable Jailbreak Attack Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04811","snapshot_observed_at":"2026-08-15T21:07:54.241085Z","title":"h4rm3l: A dynamic benchmark of composable jailbreak attacks for llm safety assessment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.241085Z"},"links":{"cited_paper":"/paper/2408.04811","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:f6b3b77353611a7ba1a9a917948c50d1e1c0df8626c8d73d8bb03d5e17de948b","observation_id":"12c35f7c-00c6-4303-8b2b-ad5f15a485d5","resolution":{"observed_at":"2026-08-15T21:07:54.241085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12273","last_updated":"2024-07-10T09:07:52Z","snapshot_observed_at":"2026-08-19T05:48:44.077653Z","submitted_at":"2024-01-22T17:11:37Z","title":"The Ethics of Interaction: Mitigating Security Threats in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12273","snapshot_observed_at":"2026-08-15T21:07:54.249235Z","title":"The ethics of interaction: Mitigating security threats in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.249235Z"},"links":{"cited_paper":"/paper/2401.12273","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:24b016bf0b96eebf29f81c2715ecce58297feac537e96d50b24ca836c7a15986","observation_id":"afd0c072-8f98-45e5-950e-adae69160f5d","resolution":{"observed_at":"2026-08-15T21:07:54.249235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17003","last_updated":"2025-04-07T07:23:33Z","snapshot_observed_at":"2026-08-16T13:22:45.679071Z","submitted_at":"2024-08-30T04:35:59Z","title":"Safety Layers in Aligned Large Language Models: The Key to LLM Security","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17003","snapshot_observed_at":"2026-08-15T21:07:54.253022Z","title":"Safety layers in aligned large language models: The key to llm security","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.253022Z"},"links":{"cited_paper":"/paper/2408.17003","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:e947266792e6b683d3a555b0913ed1e26e3c0c166d9db341ba555b41cd38bde1","observation_id":"1d9d3cf5-292e-417d-addf-6855bbb2cd63","resolution":{"observed_at":"2026-08-15T21:07:54.253022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:54.679577Z","title":"do anything now","venue":null,"work_id":"fb3c48d1-dc4c-445f-ba19-221ccd4f1f8a","year":2025},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.256701Z"},"links":{"citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:07b04a347bbd208685b0a018421e6d449ee13e2c4564c515fb8de5e6d8ac826c","observation_id":"b2a8cdaf-56a9-4f85-9777-daeac4b660b5","resolution":{"observed_at":"2026-08-15T21:07:54.683112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:54.260409Z","title":"Latentqa: Teaching llms to decode activations into natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.260409Z"},"links":{"citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:56f0023ecbb97752289ac1403c0380a243f412489bc24f80fbe777c536f2a147","observation_id":"4d4dd1ba-e018-459d-861e-1072918808dd","resolution":{"observed_at":"2026-08-15T21:07:54.260409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-15T21:07:54.263941Z","title":"Ad- vprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.263941Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:2f1b147c349fdaf81d452320cd9090c5e898fd619c6f4959e1e27557de363718","observation_id":"e6972e7f-d34c-480e-8fb5-a6679c73ba4e","resolution":{"observed_at":"2026-08-15T21:07:54.263941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:54.668808Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"1b4f1b29-c7f5-4025-b234-5d7a332bf8cd","year":2024},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.267903Z"},"links":{"citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:c7ce541a28d37f104917891b93b8788a4464260a994b9e9d88f22572518e1e82","observation_id":"13e823af-61a1-4d3a-8fcd-f0d0f6006a17","resolution":{"observed_at":"2026-08-15T21:07:54.673175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-15T21:07:54.271485Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.271485Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:b4186a56ea1a3fd2b129e7701978474b110d67e4cbc73eff7fc311c07a6d94ec","observation_id":"56603d5d-99cb-42b3-bd00-823844663d00","resolution":{"observed_at":"2026-08-15T21:07:54.271485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-16T14:45:33.781904Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-15T21:07:54.275044Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.275044Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:161898f51f58a7bf4406b5886973deee6322d854994aef2e7362a8802e33674c","observation_id":"560e6ea2-ec0d-478a-8667-281a510804c1","resolution":{"observed_at":"2026-08-15T21:07:54.275044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:54.656986Z","title":"do anything now","venue":null,"work_id":"8d20fd64-2cf7-43b0-a8da-b2e3c84f8789","year":2024},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.278787Z"},"links":{"citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:10b5234472234b5705ed955f1a9c5b46b9a9414bf249956e3c7a47e18bbaf700","observation_id":"ada4356b-fe2b-4e22-b20a-127aa1d8ce32","resolution":{"observed_at":"2026-08-15T21:07:54.661845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-20T20:23:20.798055Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-15T21:07:54.282513Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.282513Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:871980a757295c042d37f0226aa0f2b147d9af201facbde6741718ca82505f21","observation_id":"df76b44f-9918-48b2-9a4b-4d133ffe3090","resolution":{"observed_at":"2026-08-15T21:07:54.282513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11409","last_updated":"2024-06-19T02:37:50Z","snapshot_observed_at":"2026-08-16T21:13:11.293578Z","submitted_at":"2024-06-17T10:54:35Z","title":"CodeGemma: Open Code Models Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11409","snapshot_observed_at":"2026-08-15T21:07:54.286434Z","title":"Codegemma: Open code models based on gemma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.286434Z"},"links":{"cited_paper":"/paper/2406.11409","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:efab03f00b7b973b33c1e1df6ff5428c22f48027cd913d319636bad613dab9ba","observation_id":"d3d04e62-d5d7-455a-93bf-b027e88c856d","resolution":{"observed_at":"2026-08-15T21:07:54.286434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T21:07:54.290345Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.290345Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:cba56e47e36a6762ebfae336f7ec1f4a406e25435c461500850e11df7d152cf2","observation_id":"4c3798b9-88a7-4d5d-860d-032fbfe94e9e","resolution":{"observed_at":"2026-08-15T21:07:54.290345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T21:07:54.293852Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.293852Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:413b7f3e156dd5b4ce664a61642650b230e7434d0ca55dfd9fc0cb08df050073","observation_id":"8be58ad4-c78b-41cd-8468-6e7ef2e02092","resolution":{"observed_at":"2026-08-15T21:07:54.293852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-15T21:07:54.297752Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.297752Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:b58f11e41604390f12a87ac7dda5ee9740930b761a6d3efa59eb92d15791330c","observation_id":"26789c46-4c3d-493b-bfd0-528e5ef4a00e","resolution":{"observed_at":"2026-08-15T21:07:54.297752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04223","last_updated":"2025-05-11T03:35:52Z","snapshot_observed_at":"2026-08-17T09:31:27.769249Z","submitted_at":"2024-11-06T19:39:48Z","title":"Diversity Helps Jailbreak Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04223","snapshot_observed_at":"2026-08-15T21:07:54.301502Z","title":"Diversity helps jailbreak large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.301502Z"},"links":{"cited_paper":"/paper/2411.04223","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:58403c860969b4d3170a008a77b5ba1df80d287c52f1b809c978b0ac144b58eb","observation_id":"79d9aee2-1d1a-4180-a597-2876a0025a83","resolution":{"observed_at":"2026-08-15T21:07:54.301502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T21:07:54.305218Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.305218Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:436750ab88df6fa76e9c6959edca40a9c897ad773b1e39afc979e843c7df8819","observation_id":"3e84eb57-77db-4962-bb35-0430c05f9b81","resolution":{"observed_at":"2026-08-15T21:07:54.305218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:54.245356Z","title":"Guard: Role-playing to generate natural-language jailbreakings to test guideline adherence of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.245356Z"},"links":{"citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:c322b94c949ff8878733001883c4a6a6044ead175845a0636a5608a6d754a457","observation_id":"f4ae84b9-2f5c-4a1f-937f-4762ea740237","resolution":{"observed_at":"2026-08-15T21:07:54.245356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-15T21:07:54.228190Z","title":"Jailbreaking leading safety- aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.228190Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:34216c35b476d3eb3d584845b76c74fa90c9f8c6d8ee3549264752cb745c588c","observation_id":"86f0df2b-8e00-4c46-9f38-42f629633b82","resolution":{"observed_at":"2026-08-15T21:07:54.228190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-15T21:07:54.223932Z","title":"Detecting language model attacks with perplexity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.223932Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:662ddafd3ab3a33e4fc3bf68d87f3f38643ab0358e4200cf42bcdce7ee9a4596","observation_id":"70f1671c-982a-4930-a56b-a59c05ffe13e","resolution":{"observed_at":"2026-08-15T21:07:54.223932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 3 inbound Pith citation observations for arXiv:2505.10838."}