{"as_of":"2026-08-23T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b53f592d86377cfd2bd21bd78b8ad47304dc0155b202740525470396004077e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:29:59.265087Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:36:25.412835Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-12T18:32:12.116128Z","title":"Cross-modality safety alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11496","last_updated":"2024-11-28T02:07:46Z","snapshot_observed_at":"2026-08-14T06:21:41.085599Z","submitted_at":"2024-11-18T11:58:07Z","title":"Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:32:12.116128Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2411.11496"},"observation_digest":"sha256:a28ef0bb55649f206c0c7c2bd1393394218094046d48bfcaec2d7b3733adc080","observation_id":"8b07a41e-f589-4850-94ef-e730e811077a","resolution":{"observed_at":"2026-08-12T18:32:12.116128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-12T05:56:46.546901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-17T19:34:58.995686Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T05:56:46.546901Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2411.19939"},"observation_digest":"sha256:a42731255c012210c74dc94d243c21669c1812d44c4a4bb5ff5903baccfaed10","observation_id":"33e34e23-58f2-46f8-9fd3-d812f6fc3a2c","resolution":{"observed_at":"2026-08-12T05:56:46.546901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-11T20:17:02.816417Z","title":"Cross-modality safety alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05934","last_updated":"2025-08-18T03:40:02Z","snapshot_observed_at":"2026-08-16T08:39:17.362388Z","submitted_at":"2024-12-08T13:20:45Z","title":"Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:17:02.816417Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2412.05934"},"observation_digest":"sha256:837403814686b8a4abc32c8f622b12a1db151b41ef7e940081029cd92e3270a8","observation_id":"db440eb6-53fa-4b5e-90bf-dfbb5a0e6ade","resolution":{"observed_at":"2026-08-11T20:17:02.816417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T19:45:20.094457Z","title":"Cross-modality safety alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-19T23:05:04.502790Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:20.094457Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:bb36d88aa3b5dfb62d0221b2f29efaa611cb6d6c8c1a96d42251cc0b955a0307","observation_id":"60d7a020-cc9e-45c7-8218-438ade4fa302","resolution":{"observed_at":"2026-08-07T19:45:20.094457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-16T10:29:59.265087Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18053","last_updated":"2025-06-05T16:13:05Z","snapshot_observed_at":"2026-08-18T00:01:48.383371Z","submitted_at":"2025-04-25T03:54:24Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T10:29:59.265087Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2504.18053"},"observation_digest":"sha256:9d7357f383fba6dd7cdd2294ad0e203cfaa4258ad5925f25fef9ce96dfec6aa0","observation_id":"843de802-8fef-408b-a208-006bb50228d5","resolution":{"observed_at":"2026-08-16T10:29:59.265087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T15:43:25.330017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14035","last_updated":"2025-05-20T07:31:17Z","snapshot_observed_at":"2026-08-20T18:08:58.552890Z","submitted_at":"2025-05-20T07:31:17Z","title":"ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:25.330017Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2505.14035"},"observation_digest":"sha256:ef71f5c0f4ab89fe74ca099adf573a1fbc88c6a9c504a8dae395c7d09d94e043","observation_id":"9203d1f4-63b2-4295-bffb-2000749da03c","resolution":{"observed_at":"2026-08-07T15:43:25.330017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T15:06:33.559562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17144","last_updated":"2025-05-22T07:30:01Z","snapshot_observed_at":"2026-08-20T08:48:05.067676Z","submitted_at":"2025-05-22T07:30:01Z","title":"MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:06:33.559562Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2505.17144"},"observation_digest":"sha256:62ba7c10fa44ccc8160ff32df1b583cd9463c372eff76553096e237a8065c8ba","observation_id":"ed14b304-646f-45a4-b3ae-915789c18f81","resolution":{"observed_at":"2026-08-07T15:06:33.559562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T13:22:02.762002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-13T10:28:38.070941Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.762002Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:9c06a517d3b3b23a5428a1f93ebc3b97bd9a6b0112feaa984c724d8341436cee","observation_id":"d9418b88-1f0e-4957-9ca1-fd398b28f113","resolution":{"observed_at":"2026-08-07T13:22:02.762002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2406.15279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-07-02T01:36:25.412835Z","title":"Cross-modality safety alignment","venue":null,"work_id":"b573ee9f-5a37-486b-b2ca-bfddc2fdc25d","year":2024},"citing_paper":{"arxiv_id":"2506.09067","last_updated":"2026-04-09T22:50:08Z","snapshot_observed_at":"2026-08-12T22:05:05.795246Z","submitted_at":"2025-06-08T16:26:51Z","title":"Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T10:54:55.262180Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2506.09067"},"observation_digest":"sha256:142e648ae0c907f433607e63948fa8d6b0f28ad5ee8ddadf8a7809bcd3699ff2","observation_id":"18b7abbd-7c89-4d68-ab8c-0b90f78b3d6c","resolution":{"observed_at":"2026-05-19T10:57:16.520469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-06T17:21:35.344438Z","title":"Cross-Modality Safety Alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-14T03:33:23.638520Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.344438Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:b0f46a4489bd3f253f04658c79fc8882c330254f268759ef418f653e73c7b809","observation_id":"0e60edac-3f2c-4201-8a5d-126e1d465497","resolution":{"observed_at":"2026-08-06T17:21:35.344438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-06T14:37:19.480378Z","title":"Safeinputsbutunsafeoutput: Benchmarkingcross-modalitysafetyalignment oflargevision-languagemodel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18576","last_updated":"2025-08-07T08:02:42Z","snapshot_observed_at":"2026-08-14T22:57:37.694164Z","submitted_at":"2025-07-24T16:49:19Z","title":"SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\\circ}$ Law","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:19.480378Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2507.18576"},"observation_digest":"sha256:a089c00f20e5b11d002459b438da174532ea3bde47921450d993704910d9d71d","observation_id":"f3c296d3-290b-4809-9422-5c9e6715ac8a","resolution":{"observed_at":"2026-08-06T14:37:19.480378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-15T16:55:12.511058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19493","last_updated":"2025-09-03T07:48:34Z","snapshot_observed_at":"2026-08-16T20:48:20.351223Z","submitted_at":"2025-08-27T00:41:28Z","title":"Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T16:55:12.511058Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2508.19493"},"observation_digest":"sha256:b2a3446d9790bfc8c167fb917fcd8e45018612a25b7c91d3d7ccf8279288b046","observation_id":"c9fd0bf0-6605-4fbb-9531-0c3568e82fe6","resolution":{"observed_at":"2026-08-15T16:55:12.511058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2406.15279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-07-02T01:36:25.412835Z","title":"Cross-modality safety alignment","venue":null,"work_id":"b573ee9f-5a37-486b-b2ca-bfddc2fdc25d","year":2024},"citing_paper":{"arxiv_id":"2606.03089","last_updated":"2026-08-13T08:19:05Z","snapshot_observed_at":"2026-08-16T23:09:40.763385Z","submitted_at":"2026-06-02T03:17:56Z","title":"Constitutional On-Policy Safe Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T11:47:14.135793Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2606.03089"},"observation_digest":"sha256:afcf440824f45c30ff4ac04b2bbf7d42540fc92f529c1f2e88918785a04684ec","observation_id":"ea7b93f3-f454-47d7-81e0-6756f6f84de9","resolution":{"observed_at":"2026-07-02T01:36:25.415091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.15279/citation-record","integrity":"/paper/2406.15279/integrity","json":"/paper/2406.15279/citation-record.json","paper":"/paper/2406.15279"},"outbound":[],"paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T13:40:41.378998Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2406.15279."}