{"as_of":"2026-08-10T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21b3d3a3bbb1794704fa6c8a7d056b2e5c2b72ba0dfce801f8a4c4e683610a30","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:34:37.431217Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24232/citation-record","integrity":"/paper/2505.24232/integrity","json":"/paper/2505.24232/citation-record.json","paper":"/paper/2505.24232"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.447358Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.447358Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:9fc031745c318edde3571990274a8931a7611c85dc3cdf66864d8ea6f983a25d","observation_id":"e35ecabd-0d1e-4c7b-9611-f606becda309","resolution":{"observed_at":"2026-08-07T12:34:32.447358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-07T12:34:32.513188Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.513188Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:2594551d32b0ec5e6951c162dbb346ca41dc5d77add45649d0d21ec1902625d1","observation_id":"c1d163ed-ece8-4eee-8c4a-5f1de2657dcd","resolution":{"observed_at":"2026-08-07T12:34:32.513188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.562775Z","title":"Defending chatgpt against jailbreak attack via self-reminders.Nature Machine Intelligence, 5(12):1486–1496, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.562775Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:154ce5f6a2d640240f4baac508671e96f7c2f071ed367beaf2cae1655c59e9d3","observation_id":"6b6dafde-1e18-4ff5-a51d-c0f0326916f1","resolution":{"observed_at":"2026-08-07T12:34:32.562775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:32.729370Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.729370Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:b9abd5959c8f43c6888499d65b3ec21a8b9e29a70ffff7e5bc4122833b021ea8","observation_id":"ab5dc5e0-dbe8-408b-ad5b-74309992baaa","resolution":{"observed_at":"2026-08-07T12:34:32.729370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:34:32.878990Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:32.878990Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:406cfee6eed6c6b418423369b12ebd89f25eeca2266200f9b621c6f06672f58b","observation_id":"7d16e534-ae4a-4e03-a9e5-8de253fa91a5","resolution":{"observed_at":"2026-08-07T12:34:32.878990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:33.055462Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.055462Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:3d2a714a70560269ec67e3210933164c1aff9ca070ce88ff31e9fd4ce75ed86d","observation_id":"228d84c1-4589-483e-83c3-3e103d475d26","resolution":{"observed_at":"2026-08-07T12:34:33.055462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07071","last_updated":"2024-10-03T17:26:48Z","snapshot_observed_at":"2026-08-08T13:33:34.788877Z","submitted_at":"2024-07-09T17:44:34Z","title":"Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07071","snapshot_observed_at":"2026-08-07T12:34:33.183946Z","title":"Lookback lens: Detecting and mitigating contextual hallucinations in large language models using only attention maps.arXiv preprint arXiv:2407.07071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.183946Z"},"links":{"cited_paper":"/paper/2407.07071","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:9f7ede3c03126080a5a5376bcd66a4a756955f3c8b48e924e32871d058a4b680","observation_id":"4c6fcf8d-c3d7-485e-b0e3-0974b692ccc8","resolution":{"observed_at":"2026-08-07T12:34:33.183946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15098","last_updated":"2024-04-17T04:25:21Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:48:55Z","title":"Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15098","snapshot_observed_at":"2026-08-07T12:34:33.321878Z","title":"Attention satisfies: A constraint-satisfaction lens on factual errors of language models.arXiv preprint arXiv:2309.15098, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.321878Z"},"links":{"cited_paper":"/paper/2309.15098","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:7f9c65087b46f515670981118a4ec8513d5418959e42edee780eeb31023a0075","observation_id":"7ca8e42f-9646-4f40-b65c-8ee8cde55c58","resolution":{"observed_at":"2026-08-07T12:34:33.321878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-07T12:34:33.468297Z","title":"The internal state of an llm knows when it’s lying.arXiv preprint arXiv:2304.13734, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.468297Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ed12690afc6c9bd0a1aadea67f81a7aa353334e59e89ab27d75d5153d98d86f7","observation_id":"bf596b9f-910d-46d3-b4a9-aa9a91c2ae6b","resolution":{"observed_at":"2026-08-07T12:34:33.468297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.501583Z","title":"Llm factoscope: Uncovering llms’ factual discernment through measuring inner states","venue":null,"work_id":"7eace675-3ae9-48ea-b340-63486b9ca923","year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.585739Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:283d94afa538358052735d1cd4e578be698a5923560be272b6875d0c6605d8fb","observation_id":"8e9f5913-57a1-4726-9a22-4937b27042c4","resolution":{"observed_at":"2026-08-07T12:34:39.576187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19648","last_updated":"2024-05-30T03:00:47Z","snapshot_observed_at":"2026-08-09T19:28:56.396561Z","submitted_at":"2024-05-30T03:00:47Z","title":"Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19648","snapshot_observed_at":"2026-08-07T12:34:33.685570Z","title":"Detecting hallucinations in large language model generation: A token probability approach.arXiv preprint arXiv:2405.19648, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.685570Z"},"links":{"cited_paper":"/paper/2405.19648","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:1e08bbd4a8ffef2891f0cc12ccdc69073afa73b04b696404f9f4dfb1d0415d28","observation_id":"0bf08dfa-e27a-450f-a48a-f511d3f98adb","resolution":{"observed_at":"2026-08-07T12:34:33.685570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T12:34:33.845038Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:33.845038Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:7c9187bb6455d292daaa7361327224e976ec0b484535274da6bb6c7a2947123c","observation_id":"99ffbb33-564d-47a1-b37d-2b06830a0d9e","resolution":{"observed_at":"2026-08-07T12:34:33.845038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-07T12:34:34.003149Z","title":"Autodan: Automatic and interpretable adversarial attacks on large language models.arXiv preprint arXiv:2310.15140, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.003149Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:931d3907b7df25dd4cc0276945e04fd649ebb163f1888b61439f7fe4ef117133","observation_id":"25e2e540-3aba-44b3-850c-3469a159a4b6","resolution":{"observed_at":"2026-08-07T12:34:34.003149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:34.167588Z","title":"Guard: Role-playing to generate natural-language jailbreakings to test guideline adherence of large language models.arXiv preprint arXiv:2402.03299, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.167588Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:0aa51bc4b076391f548c5d61d33ff56c36d9faea27cde0d559ecb9e279a302bc","observation_id":"a0cad85c-55d5-4f37-9815-ac974c527827","resolution":{"observed_at":"2026-08-07T12:34:34.167588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20413","last_updated":"2024-05-30T18:38:36Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T18:38:36Z","title":"Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20413","snapshot_observed_at":"2026-08-07T12:34:34.241608Z","title":"Jailbreaking large language models against moderation guardrails via cipher characters.arXiv preprint arXiv:2405.20413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.241608Z"},"links":{"cited_paper":"/paper/2405.20413","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:d9e3fefb438eabc24e1d33867601cc784074e6e5bf6f33d50d8e91c6ade678a4","observation_id":"79c19ef7-639f-4dca-99db-c8d3a743b0e5","resolution":{"observed_at":"2026-08-07T12:34:34.241608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T12:34:34.347192Z","title":"Jailbreaking black box large language models in twenty queries.arXiv preprint arXiv:2310.08419, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.347192Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5a74dc3d37ccc11c099fc1b475c16c6f348c0d81db510f2c977c0fcadf754164","observation_id":"29787c52-bcc5-40eb-8475-36a31bd4a65a","resolution":{"observed_at":"2026-08-07T12:34:34.347192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:34.434538Z","title":"Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models.arXiv preprint arXiv:2407.01599, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.434538Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:55d107e06387a28a94e31c4125735189889b4b075ac98b15fa2240cfbf36622b","observation_id":"06467daa-7a79-41c9-a2a9-30d088d57aaa","resolution":{"observed_at":"2026-08-07T12:34:34.434538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-07T12:34:34.521629Z","title":"Multi-step jailbreaking privacy attacks on chatgpt.arXiv preprint arXiv:2304.05197, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.521629Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:b4304890bf9fce18a436fd2919a07144a23d7c3be6b5364f37a45091db870d52","observation_id":"b71f90d3-ed83-411a-953f-8f89b9ec73c1","resolution":{"observed_at":"2026-08-07T12:34:34.521629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08979","last_updated":"2023-10-05T13:27:12Z","snapshot_observed_at":"2026-07-30T23:17:31.332560Z","submitted_at":"2023-04-18T13:20:45Z","title":"In ChatGPT We Trust? Measuring and Characterizing the Reliability of ChatGPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08979","snapshot_observed_at":"2026-08-07T12:34:34.621558Z","title":"In chatgpt we trust? measuring and characterizing the reliability of chatgpt.arXiv preprint arXiv:2304.08979, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.621558Z"},"links":{"cited_paper":"/paper/2304.08979","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5de2bb799be180c94eafb81013010f00b634873b30d7305589211aa81b328cf0","observation_id":"75a00167-735f-4d5b-84bf-38140ee83424","resolution":{"observed_at":"2026-08-07T12:34:34.621558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-08T18:11:45.725753Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-07T12:34:34.714953Z","title":"Jailbroken: How does llm safety training fail?arXiv preprint arXiv:2307.02483, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.714953Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:23b1723e65ea0fe2f8689d2da5d518ba1a17afb1c9fe64fb1b16eca24bcf75da","observation_id":"47e5f63f-0824-4a7c-a89a-75e1252df0cb","resolution":{"observed_at":"2026-08-07T12:34:34.714953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12329","last_updated":"2024-12-07T23:09:49Z","snapshot_observed_at":"2026-08-09T02:17:48.121135Z","submitted_at":"2024-02-19T18:01:36Z","title":"Query-Based Adversarial Prompt Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12329","snapshot_observed_at":"2026-08-07T12:34:34.809699Z","title":"Query- based adversarial prompt generation.arXiv preprint arXiv:2402.12329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.809699Z"},"links":{"cited_paper":"/paper/2402.12329","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:857c2300b5de99f42fbb2e68b23e61e77c21ef83eb3d14be25b410f1e4c6f026","observation_id":"cc291607-87bc-4601-8fff-56431417bdf9","resolution":{"observed_at":"2026-08-07T12:34:34.809699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07865","last_updated":"2024-09-14T11:41:49Z","snapshot_observed_at":"2026-08-08T03:05:44.913138Z","submitted_at":"2024-03-12T17:55:38Z","title":"CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07865","snapshot_observed_at":"2026-08-07T12:34:34.930392Z","title":"Ex- ploring safety generalization challenges of large language models via code.arXiv preprint arXiv:2403.07865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:34.930392Z"},"links":{"cited_paper":"/paper/2403.07865","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:d9d5a83445c2e7ef0056f16fee593bc361380277f7036213580499ed568070df","observation_id":"b24cd802-df9b-4580-8ccb-2f148221cb3a","resolution":{"observed_at":"2026-08-07T12:34:34.930392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16914","last_updated":"2024-11-11T23:08:20Z","snapshot_observed_at":"2026-08-08T10:16:33.808623Z","submitted_at":"2024-02-25T17:43:29Z","title":"DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16914","snapshot_observed_at":"2026-08-07T12:34:35.024627Z","title":"Drattack: Prompt decomposition and reconstruction makes powerful llm jailbreakers.arXiv preprint arXiv:2402.16914, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.024627Z"},"links":{"cited_paper":"/paper/2402.16914","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:dadc80ea75e1002cfca0c084fe7068e221ed3d6433a3bb94cd4904bc42cdef42","observation_id":"bdcec99b-775e-4fe4-8083-8ac83e1925fc","resolution":{"observed_at":"2026-08-07T12:34:35.024627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-07T12:34:35.156845Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher.arXiv preprint arXiv:2308.06463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.156845Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:2bf82afd0a5f2aed783841b6758595d88c9fb9f0503b366f66589e960f3794e7","observation_id":"25ce4ff6-5ffe-4b86-864f-aa98df872c3b","resolution":{"observed_at":"2026-08-07T12:34:35.156845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:35.268065Z","title":"Jailbreaking proprietary large language models using word substitution cipher.arXiv preprint arXiv:2402.10601, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.268065Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ac834026921b3679bbcaa267495739766f884fc36a852a9becf2acffbbbfa379","observation_id":"c52ceef5-c819-4a08-b794-1da06089cc8c","resolution":{"observed_at":"2026-08-07T12:34:35.268065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:35.415641Z","title":"Are aligned neural networks adversarially aligned?Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.415641Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:3b8c9cec05d15237bf888e2840f31fa375d546790c88e003382d762620dce85d","observation_id":"308a610b-bc2e-431e-b044-508bc991be46","resolution":{"observed_at":"2026-08-07T12:34:35.415641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16934","last_updated":"2023-10-29T12:32:19Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T13:49:44Z","title":"On Evaluating Adversarial Robustness of Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16934","snapshot_observed_at":"2026-08-07T12:34:35.513830Z","title":"On evaluating adversarial robustness of large vision-language models.arXiv preprint arXiv:2305.16934, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.513830Z"},"links":{"cited_paper":"/paper/2305.16934","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:4414d44ba18b466d35acab6b6ffcf7168f6d2194c5df9959027158d1fc4f607f","observation_id":"a9546250-14fd-4632-86b1-3034e8ad0d68","resolution":{"observed_at":"2026-08-07T12:34:35.513830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-09T21:14:39.812982Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-07T12:34:35.624649Z","title":"Visual adversarial examples jailbreak large language models.arXiv preprint arXiv:2306.13213, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.624649Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:6f5a0090dac0311bbfc1097e2d0873317ce4c0275fcc87de8fb9f68799802fba","observation_id":"cfa67e39-094b-494c-8967-ee361b543bc3","resolution":{"observed_at":"2026-08-07T12:34:35.624649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.343126Z","title":"On the adversarial robustness of multi-modal founda- tion models","venue":null,"work_id":"46d90a1f-7a90-4eed-b3e4-2251c97e7ee7","year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.729482Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:96660fe1c106172007cbf32250717b8c0b1015b4b4099a560b0040cd792af0e4","observation_id":"75ed4a4d-394e-4782-845e-8d1011d2d211","resolution":{"observed_at":"2026-08-07T12:34:39.409736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-07T12:34:35.811622Z","title":"Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks.arXiv preprint arXiv:2404.03027, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.811622Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:4be97b9f12fabce939e3f27186085f647643c954f5b617cc7b4d127097dc5f8f","observation_id":"4fbd0ab7-905c-4e47-86f0-224db5bb024e","resolution":{"observed_at":"2026-08-07T12:34:35.811622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12053","last_updated":"2024-06-17T19:46:05Z","snapshot_observed_at":"2026-08-08T01:10:24.077272Z","submitted_at":"2024-06-17T19:46:05Z","title":"InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12053","snapshot_observed_at":"2026-08-07T12:34:35.908111Z","title":"Internalinspector I2: Robust confidence estimation in llms through internal states.arXiv preprint arXiv:2406.12053, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.908111Z"},"links":{"cited_paper":"/paper/2406.12053","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:b04ac93997a78bbdfbf4ad6a875a477bac7db3eaf770c57b2917eea08a781b5f","observation_id":"8d5d5faa-34ed-4891-aed0-77149d82e322","resolution":{"observed_at":"2026-08-07T12:34:35.908111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09733","last_updated":"2024-02-15T06:14:55Z","snapshot_observed_at":"2026-08-09T23:49:47.407182Z","submitted_at":"2024-02-15T06:14:55Z","title":"Do LLMs Know about Hallucination? An Empirical Investigation of LLM's Hidden States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09733","snapshot_observed_at":"2026-08-07T12:34:35.999122Z","title":"Do llms know about hallucination? an empirical investigation of llm’s hidden states.arXiv preprint arXiv:2402.09733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:35.999122Z"},"links":{"cited_paper":"/paper/2402.09733","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:a5e0cb4167683dc98e02438054927d05de17b8e6bc7e0226fcf8c1a56536aa8b","observation_id":"88b0f8bd-44d8-4046-9f84-f6627fb9abde","resolution":{"observed_at":"2026-08-07T12:34:35.999122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00034","last_updated":"2025-02-26T14:07:05Z","snapshot_observed_at":"2026-07-06T18:23:27.760658Z","submitted_at":"2024-05-26T21:39:53Z","title":"Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00034","snapshot_observed_at":"2026-08-07T12:34:36.079992Z","title":"Adaptive activation steering: A tuning-free llm truthfulness improvement method for diverse hallucinations categories.arXiv preprint arXiv:2406.00034, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.079992Z"},"links":{"cited_paper":"/paper/2406.00034","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:44d024948b820a122ab9ca7c448f505881818177ae1a46dc8178b4a42cfc01a4","observation_id":"c1cd4eaf-7b93-47b5-9414-62d703309478","resolution":{"observed_at":"2026-08-07T12:34:36.079992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03744","last_updated":"2024-10-21T04:10:50Z","snapshot_observed_at":"2026-08-09T13:56:44.744835Z","submitted_at":"2024-02-06T06:23:12Z","title":"INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03744","snapshot_observed_at":"2026-08-07T12:34:36.185423Z","title":"Inside: Llms’ internal states retain the power of hallucination detection.arXiv preprint arXiv:2402.03744, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.185423Z"},"links":{"cited_paper":"/paper/2402.03744","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:3ba2bff2f64b83678f54d5602eeb113deb4c695b42da9bff13f1d9eeed9f88a6","observation_id":"3f94b444-3932-4159-a2b9-fb24652fb22b","resolution":{"observed_at":"2026-08-07T12:34:36.185423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06448","last_updated":"2024-06-10T05:48:30Z","snapshot_observed_at":"2026-07-06T17:42:24.853273Z","submitted_at":"2024-03-11T05:51:03Z","title":"Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06448","snapshot_observed_at":"2026-08-07T12:34:36.282420Z","title":"Unsupervised real-time hallucination detection based on the internal states of large language models.arXiv preprint arXiv:2403.06448, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.282420Z"},"links":{"cited_paper":"/paper/2403.06448","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:353967a29b99e0f586f91cdb8b2b5bb5e6e0bce2157a4f350ee85361f107141b","observation_id":"3baef64a-4f67-42b3-a59d-ec7f2c243386","resolution":{"observed_at":"2026-08-07T12:34:36.282420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01469","last_updated":"2024-08-04T16:26:14Z","snapshot_observed_at":"2026-08-09T08:28:02.465215Z","submitted_at":"2023-10-02T17:01:56Z","title":"LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01469","snapshot_observed_at":"2026-08-07T12:34:36.391398Z","title":"Llm lies: Hallucinations are not bugs, but features as adversarial examples.arXiv preprint arXiv:2310.01469, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.391398Z"},"links":{"cited_paper":"/paper/2310.01469","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:2aa637b8ea61d56d52435fdac5d8a87f6ae989032ed3c99ce24d928b5f9408d2","observation_id":"0fde98d1-3178-4553-82be-f66021aa2fbc","resolution":{"observed_at":"2026-08-07T12:34:36.391398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.498025Z","title":"Are sixteen heads really better than one? Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.498025Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:d7727b8a04965d47891528b6cfd181c89bd012e1e383ea9c5fdd4d935103ee7a","observation_id":"91ee52b9-20e9-4240-a91b-7ce7c1e36166","resolution":{"observed_at":"2026-08-07T12:34:36.498025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-07T12:34:36.609925Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.609925Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:a24223d4863cf8eddf9101147ecbc3aaa056270d57ef042359740f2fb84149c0","observation_id":"38e9fd75-f90e-4821-880c-ac10222c7841","resolution":{"observed_at":"2026-08-07T12:34:36.609925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.681348Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.681348Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:3ce5f99a65fa416533bfe07f4c50940a2f9d7b6a5a2d4b49e36e80e3fcdb6536","observation_id":"0b2ecfab-c7d8-4841-aad9-c93d781795bd","resolution":{"observed_at":"2026-08-07T12:34:36.681348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10900","last_updated":"2024-10-09T03:42:22Z","snapshot_observed_at":"2026-08-08T04:34:36.202690Z","submitted_at":"2024-06-16T11:44:43Z","title":"AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10900","snapshot_observed_at":"2026-08-07T12:34:36.773583Z","title":"Autohallusion: Auto- matic generation of hallucination benchmarks for vision-language models.arXiv preprint arXiv:2406.10900, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.773583Z"},"links":{"cited_paper":"/paper/2406.10900","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:09c0ad413a5d723de497a8b744d4d56d25693c6f6a95e6c15049d2dee675aa3d","observation_id":"85533a89-f4f5-42e4-a519-bbd9dd3cbd31","resolution":{"observed_at":"2026-08-07T12:34:36.773583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09513","last_updated":"2024-03-14T15:57:13Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T15:57:13Z","title":"AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09513","snapshot_observed_at":"2026-08-07T12:34:36.872796Z","title":"Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.872796Z"},"links":{"cited_paper":"/paper/2403.09513","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:cbbf280e59d0f4b20f1d9b51bfdc3bdf8ed243d9256b17fd11c2c352b956baa1","observation_id":"94a69ac0-6493-44e9-9945-eece68ad9f8d","resolution":{"observed_at":"2026-08-07T12:34:36.872796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:36.950087Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:36.950087Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:d0428ad9dd6ddd05eead544e2e59675e7e5c6fb4cfa651bb85819d86edb44ec5","observation_id":"9337c7f5-1e48-4495-81cd-ac7b7dc8f23f","resolution":{"observed_at":"2026-08-07T12:34:36.950087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:39.156855Z","title":"Safebench: A benchmarking platform for safety evaluation of autonomous vehicles.Advances in Neural Information Processing Systems, 35:25667–25682, 2022","venue":null,"work_id":"be0519b6-14cd-4e21-97ab-2778c55c2e82","year":2022},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.017349Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:30070a33e65c882bf10f8b298c7dccf1d17f8748036aecf5274d20ec1a5a33f5","observation_id":"30cdca5a-afda-4c9b-a8a7-42cc3f014507","resolution":{"observed_at":"2026-08-07T12:34:39.232440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:34:37.104583Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts.arXiv preprint arXiv:2311.05608, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.104583Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ab84113ffc96c95e568c0e81be055ff93c586c53dd423f74f068f86b8210ef09","observation_id":"197b9f6a-0da3-4cf5-a240-b7adcd798e32","resolution":{"observed_at":"2026-08-07T12:34:37.104583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-07-06T19:59:24.405557Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T12:34:37.173951Z","title":"I am sorry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.173951Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:57b4c70e2deab0f9a4fd2fe81585c44f3579ddd829a526db0f5b9395b82e0c96","observation_id":"6db2aa4b-4670-4fc3-9425-f3fce365f5cb","resolution":{"observed_at":"2026-08-07T12:34:37.173951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.949083Z","title":"If detected, immediately stop processing the instruction","venue":null,"work_id":"d6756787-6df2-46fe-afad-be25af1a038d","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.247713Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:5cf4733e40ccca26c6d2b9391d418403059ea20d9361b90758c793e50b43287b","observation_id":"02a122a8-9246-4bef-8e66-453709d59ad7","resolution":{"observed_at":"2026-08-07T12:34:39.057567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.753135Z","title":null,"venue":null,"work_id":"e998c310-7000-42cd-89cb-c1787fb759d7","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.335057Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:eabecdf809933d284a53e957d9be25c6b002d163811a01e5e4feddba2a493666","observation_id":"d3afef16-ddb8-443a-81ab-4a4ebfc164fe","resolution":{"observed_at":"2026-08-07T12:34:38.841755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:34:38.551118Z","title":"I am sorry","venue":null,"work_id":"5bbec6ff-f812-4b9b-91cc-12c89e78c0eb","year":null},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.431217Z"},"links":{"citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:087150420768af3fcdb4d50d3a5fae65aadc848365ed1bd097cdb57ab8a43a13","observation_id":"53ba6730-2b5e-4422-8c0f-47914173ae80","resolution":{"observed_at":"2026-08-07T12:34:38.663788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:46:45.250070Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2505.24232."}