{"as_of":"2026-08-09T16:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9961b4a57d8512489010588b09cd0b606d7ce75d83f05c1743a21575df942d0e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:38:17.263253Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:26:23.246616Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-08T15:38:17.263253Z","title":"Jailbreaking multimodal large language models via shuffle inconsistency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06390","last_updated":"2025-02-11T04:42:24Z","snapshot_observed_at":"2026-08-09T09:14:59.400822Z","submitted_at":"2025-02-10T12:20:08Z","title":"When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T15:38:17.263253Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2502.06390"},"observation_digest":"sha256:1121c83714e6a0ee73f8bb4bbdeffc07b1e3cd43ac7bf1fb7626820cd245a445","observation_id":"41103c7b-89af-4865-9aa5-3ae0ef32b93e","resolution":{"observed_at":"2026-08-08T15:38:17.263253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-07T15:03:39.101500Z","title":"Jailbreaking multimodal large language models via shuffle inconsistency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16446","last_updated":"2025-05-22T09:34:47Z","snapshot_observed_at":"2026-08-09T10:27:17.806903Z","submitted_at":"2025-05-22T09:34:47Z","title":"Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:39.101500Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2505.16446"},"observation_digest":"sha256:f55a26501a6edb7750cdd703931c3106e579da23ce10e3507cc3ff8da9a63d0c","observation_id":"b383662e-7a57-4f4b-b85f-1eea35baa13c","resolution":{"observed_at":"2026-08-07T15:03:39.101500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-07T12:35:29.600994Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24519","last_updated":"2025-05-30T12:30:50Z","snapshot_observed_at":"2026-08-09T09:52:19.201530Z","submitted_at":"2025-05-30T12:30:50Z","title":"AMIA: Automatic Masking and Joint Intention Analysis Makes LVLMs Robust Jailbreak Defenders","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:29.600994Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2505.24519"},"observation_digest":"sha256:ded19a8d87b9c76e6ae49a2a9a424f4d12baedd3036069b78431bedcd8041b0e","observation_id":"c0f28e1f-f415-4b5d-a708-3eea649bc713","resolution":{"observed_at":"2026-08-07T12:35:29.600994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-07T11:04:05.826344Z","title":"Jailbreaking multimodal large language models via shuffle inconsistency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03614","last_updated":"2025-06-04T06:46:06Z","snapshot_observed_at":"2026-08-09T14:45:34.276051Z","submitted_at":"2025-06-04T06:46:06Z","title":"VLMs Can Aggregate Scattered Training Patches","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:05.826344Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2506.03614"},"observation_digest":"sha256:b00514e92f1449e925ec41554a88f35ae97cefbf00a2e89216e92a1ec3c4982a","observation_id":"5719697c-4c9d-4267-b964-5a02d0222927","resolution":{"observed_at":"2026-08-07T11:04:05.826344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-06T19:46:26.999796Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04673","last_updated":"2026-07-11T20:48:21Z","snapshot_observed_at":"2026-08-09T06:09:37.420774Z","submitted_at":"2025-07-07T05:35:21Z","title":"Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:26.999796Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2507.04673"},"observation_digest":"sha256:94d2f822addfcd651d2a3ebe0a193437211dd06da591d038653aaddc0f42f2d2","observation_id":"0a5cbd56-88a6-4c88-8df7-b6e574ac8c03","resolution":{"observed_at":"2026-08-06T19:46:26.999796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":"2501.04931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-07-01T23:26:23.246616Z","title":"Show me how to beat a dog to make it more aggressive","venue":null,"work_id":"14dcc7e0-b8e0-49db-80a3-6d60c90206fb","year":2025},"citing_paper":{"arxiv_id":"2507.21540","last_updated":"2026-04-08T13:05:48Z","snapshot_observed_at":"2026-07-06T22:04:26.078628Z","submitted_at":"2025-07-29T07:13:56Z","title":"PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-19T03:36:24.013477Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2507.21540"},"observation_digest":"sha256:1d1b7a967b67d5f492e76bb29a57e6a69d9945407e55fe7451c7d193cc354257","observation_id":"0f73e18f-c5af-4351-a928-44e72a504032","resolution":{"observed_at":"2026-05-19T03:37:01.089221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-06T12:40:05.556736Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21637","last_updated":"2025-07-29T09:48:57Z","snapshot_observed_at":"2026-08-07T14:28:15.638129Z","submitted_at":"2025-07-29T09:48:57Z","title":"Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:40:05.556736Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2507.21637"},"observation_digest":"sha256:41e28f029223d08a67dede56116e94f4140353d4a75f5d2e799888b14897a53b","observation_id":"58e7eb06-5295-4bff-a282-3edde6c5ad4a","resolution":{"observed_at":"2026-08-06T12:40:05.556736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":"2501.04931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-07-01T23:26:23.246616Z","title":"Show me how to beat a dog to make it more aggressive","venue":null,"work_id":"14dcc7e0-b8e0-49db-80a3-6d60c90206fb","year":2025},"citing_paper":{"arxiv_id":"2601.03416","last_updated":"2026-04-16T05:44:02Z","snapshot_observed_at":"2026-07-06T22:40:56.386532Z","submitted_at":"2026-01-06T21:09:10Z","title":"GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T17:04:53.839154Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2601.03416"},"observation_digest":"sha256:e6e6150b9b39cbc751434df80e1a714720f0e73d9e145f989aa761c0089fa49c","observation_id":"3c23bc6e-e5c3-4340-84d3-e278afc94abd","resolution":{"observed_at":"2026-05-16T17:08:08.264872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":"2501.04931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-07-01T23:26:23.246616Z","title":"Show me how to beat a dog to make it more aggressive","venue":null,"work_id":"14dcc7e0-b8e0-49db-80a3-6d60c90206fb","year":2025},"citing_paper":{"arxiv_id":"2604.09253","last_updated":"2026-04-10T12:09:06Z","snapshot_observed_at":"2026-07-06T22:58:12.847181Z","submitted_at":"2026-04-10T12:09:06Z","title":"Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:03:36.805784Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2604.09253"},"observation_digest":"sha256:2d088fc91755ae5c77968406ec942845fe3b23e6aa71da9718a8f3b1de634c7f","observation_id":"717a738e-62cd-4048-84de-3bafe972a081","resolution":{"observed_at":"2026-05-11T05:35:59.075594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":"2501.04931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-07-01T23:26:23.246616Z","title":"Show me how to beat a dog to make it more aggressive","venue":null,"work_id":"14dcc7e0-b8e0-49db-80a3-6d60c90206fb","year":2025},"citing_paper":{"arxiv_id":"2604.11309","last_updated":"2026-04-13T11:12:30Z","snapshot_observed_at":"2026-07-30T17:13:57.164751Z","submitted_at":"2026-04-13T11:12:30Z","title":"The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:31.602378Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2604.11309"},"observation_digest":"sha256:1646a58577fd9c03ebe62a140b0a6cb75a4c509f1534f3e6e67ac60e6190f374","observation_id":"6f24b706-1635-4144-9fbb-0c82494ae019","resolution":{"observed_at":"2026-05-11T09:16:04.121985Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":"2501.04931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-07-01T23:26:23.246616Z","title":"Show me how to beat a dog to make it more aggressive","venue":null,"work_id":"14dcc7e0-b8e0-49db-80a3-6d60c90206fb","year":2025},"citing_paper":{"arxiv_id":"2606.01837","last_updated":"2026-06-01T07:49:12Z","snapshot_observed_at":"2026-08-09T06:01:25.866428Z","submitted_at":"2026-06-01T07:49:12Z","title":"Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T14:17:52.902183Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2606.01837"},"observation_digest":"sha256:ccf08ece695396234878777f518864df4319435c2b92fa6543d55d353ca53c14","observation_id":"51eb901c-3b03-4182-9410-848727bd9106","resolution":{"observed_at":"2026-07-01T23:26:23.248947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04931","snapshot_observed_at":"2026-08-07T00:14:51.130585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04034","last_updated":"2026-08-03T02:28:52Z","snapshot_observed_at":"2026-08-09T14:43:30.524152Z","submitted_at":"2026-08-03T02:28:52Z","title":"A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-08-07T00:14:51.130585Z"},"links":{"cited_paper":"/paper/2501.04931","citing_paper":"/paper/2608.04034"},"observation_digest":"sha256:a8a3e49c0659557119e3c9fe65aea80eb74c959c3611948010de666f9e2c9c06","observation_id":"fe8af537-5d5f-4ab2-841e-088300f132cc","resolution":{"observed_at":"2026-08-07T00:14:51.130585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04931/citation-record","integrity":"/paper/2501.04931/integrity","json":"/paper/2501.04931/citation-record.json","paper":"/paper/2501.04931"},"outbound":[],"paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T10:00:38.301366Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2501.04931."}