Pith. sign in

Paper Citation Record · LEDGER

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

As of 17 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 4 inbound Pith citation observations for arXiv:2505.23793.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.23793 v1

Coverage vector

measured 78 of 78 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:15:20.372542Z

measured 82 of 82 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T18:20:43.092561Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T17:37:14.921452Z

Reference resolution

78 of 78 outbound references displayed

  • verified exact0
  • verified fuzzy30
  • unresolved48
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 986062ee-f95d-4231-89c6-0ff4c9080126 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Bert: Pre-training of deep bidirectional transformers for language understanding,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:30.449940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:12.501473Z digest=sha256:05c9f89b64c7d9d2230abb1c85be550863d8e6e208753d919e7764484f3eae69

Observation 30d901d3-4ea7-4456-a82c-65507ac437b3 · outbound

This paper cites GPT-4 Technical Report.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:12.628526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:12.628526Z digest=sha256:4480bf3db41ee71f184759f637ccc5f6035b8a424d907b8a48e61dbcca1452ba

Observation 3d5e1484-76c8-4375-94c7-e64909df2901 · outbound

This paper cites A Survey of Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models A Survey of Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:12.839230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:12.839230Z digest=sha256:cd59d81c0b3ee6c09d7e18d0c36364f69cf5e174f6dc70d11128a2fe029083ca

Observation 01347fd3-8a8a-42ce-99ab-5f21d18c58b3 · outbound

This paper cites A survey of graph retrieval-augmented generation for customized large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models A survey of graph retrieval-augmented generation for customized large language models,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:13.588175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:13.588175Z digest=sha256:8dc6f4ce3316c352d240b11441fd9faae4f2422b18e23c5c23edc0e7a5613558

Observation ce125e67-c302-4f6c-aad7-14a37aa53739 · outbound

This paper cites Entity alignment with noisy annotations from large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Entity alignment with noisy annotations from large language models,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:30.270519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:13.724198Z digest=sha256:954d9bfdabd5a3cda9e531af428c00b1cb66bfef7dca5498bf182122321d0931

Observation c33d44fe-eecf-4fac-958a-8e3754a80d94 · outbound

This paper cites Differentiable neuro-symbolic reason- ing on large-scale knowledge graphs,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Differentiable neuro-symbolic reason- ing on large-scale knowledge graphs,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:30.164673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:13.798029Z digest=sha256:6d2a26dcf730dc551fd7cc868c5fce22977071cd1f5dd74e4880d8e2486b8d39

Observation 792c852f-1151-4710-90d4-5a20d32e9ccb · outbound

This paper cites A Survey on Benchmarks of Multimodal Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models A Survey on Benchmarks of Multimodal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:13.867592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:13.867592Z digest=sha256:4fab929ad3c450d2aa323c0d3aa7c96ff6d14fb3c14c1ccd997f1687881cfdf1

Observation 67256299-27b6-4bb2-93c7-fa0bee446f3c · outbound

This paper cites GPT-4o System Card.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models GPT-4o System Card

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:13.984441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:13.984441Z digest=sha256:c5584f16073044d16e4b6bedee3b67766adc247e076120fa38d12b5cb9a7c7ad

Observation a0065e08-f2df-45df-9798-2e54cc942b1c · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.127721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.127721Z digest=sha256:f2ddc0703a2fa87430b0d1f8a55c271c4c41676152f27692f831781ebdd09a8f

Observation a41746f6-c695-405c-87a4-f2817a9eaf7f · outbound

This paper cites RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.184417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.184417Z digest=sha256:01c4018bd8d870fec8cacbc14661ca46e2019d4520627aa9a65b9e1d5dbab9e0

Observation 1c2bc979-887e-44a9-92b6-a714c3824eb2 · outbound

This paper cites Multimodal Situational Safety.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Multimodal Situational Safety

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.292317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.292317Z digest=sha256:1f157e520286faf46b86915eda17141fbee2a7ab6e2380639f02feb61cf51bb7

Observation d3392940-f091-44ea-af6f-02bd69465498 · outbound

This paper cites JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.365288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.365288Z digest=sha256:9fa97e11f4f0c461e83cbb3c7ef911975b8fe890bf19a593f3cfb6de2cc2c70b

Observation 1bc9debb-bd60-4834-aa74-c78e0cfae01f · outbound

This paper cites MM-SafetyBench: A benchmark for safety evaluation of multimodal large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models MM-SafetyBench: A benchmark for safety evaluation of multimodal large language models,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:30.078912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:14.445696Z digest=sha256:8437bd4bb4a3af7f8293205dc19b16b01412b380767d32f3fede2851cb8fff67

Observation 3073b0e2-b04e-4ea1-b241-861c3677159f · outbound

This paper cites Images are achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Images are achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:29.901591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:14.508317Z digest=sha256:b2274dcc0e0a36fba98c56d037113aa630fa067b151428822afe393cf2102952

Observation 81224b51-d815-4cc8-b8d6-ff80d131f6cc · outbound

This paper cites HarmBench: A standardized evaluation framework for automated red teaming and robust refusal,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models HarmBench: A standardized evaluation framework for automated red teaming and robust refusal,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:29.583738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:14.557190Z digest=sha256:e36c35089959bd54851ad49a68ec7284d0e20c6b365cd7d2c8f414fecfd2ec6f

Observation e7377fa6-6833-4e98-b11b-30988793a172 · outbound

This paper cites MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.653615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.653615Z digest=sha256:4c6412f92c7f3d9ffe0c523e6d4c0c34a39f3f4b99471a95a543254ec708b083

Observation 4bad3ab9-b982-4dec-b1b5-0c6a2b0f5136 · outbound

This paper cites VLSBench: Unveiling Visual Leakage in Multimodal Safety.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models VLSBench: Unveiling Visual Leakage in Multimodal Safety

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.746223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.746223Z digest=sha256:e46c831e396912faaf3a10fb8fad8a76d7eb4ae521626d68fc6a6e771e9b837a

Observation b48dfcef-a75e-4f09-bc53-c11b55f00d6b · outbound

This paper cites MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:14.833561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:14.833561Z digest=sha256:599a19b1c6b4251bce3ba845491070bb4d631d8872e5d29d40d90707b43bf59c

Observation 11031a20-8e20-4e19-a806-c1974e1becf0 · outbound

This paper cites MLLMGuard: A multi-dimensional safety evaluation suite for multimodal large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models MLLMGuard: A multi-dimensional safety evaluation suite for multimodal large language models,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:29.347012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:14.911634Z digest=sha256:a473e4647f224d64d72463b15129133562d9efb055f554f78482eed2a2114039

Observation f18a4617-51f3-489e-9865-bd2b81a2d2d0 · outbound

This paper cites Red teaming visual language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Red teaming visual language models,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:29.099603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:14.981314Z digest=sha256:69ffef782c1d88b54be8e00b99c5cd16852b4ced57f1328270f94373bc67806d

Observation a5d1d146-28b3-4733-ba5a-9ebf9c15d481 · outbound

This paper cites DRESS : Instructing large vision- language models to align and interact with humans via natural language feedback,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models DRESS : Instructing large vision- language models to align and interact with humans via natural language feedback,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:28.851380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:15.066515Z digest=sha256:fc2fc836add1fa2eb5f72267247b78ab09b73552b503ecdc5ddcf6299f969704

Observation c8b74500-d09d-4033-8f3b-8dfcfc51f3cd · outbound

This paper cites Safety fine-tuning at (almost) no cost: A baseline for vision large language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Safety fine-tuning at (almost) no cost: A baseline for vision large language models,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:28.572555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:15.141821Z digest=sha256:593f52ab508add08afb9770d3c20009cd35497628766dc00d4c61b1812c96a68

Observation 4c35aa6d-af23-4ccd-b6cd-39e70e21f35e · outbound

This paper cites SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.211995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.211995Z digest=sha256:946f940f79fbe2448fb282440ec41e20c42e1a3b48e8d788306614529aa9e2b0

Observation c6bd229b-582d-4536-895f-3708f8ddd20a · outbound

This paper cites How many are in this image a safety evaluation benchmark for vision LLMs,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models How many are in this image a safety evaluation benchmark for vision LLMs,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:28.333140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:15.306757Z digest=sha256:6bda06085d348111457173c86f03a48d1daa04c7ee3e76dd6b69eda666b779cc

Observation c95c9956-7f2b-464b-bbfe-63974186c09d · outbound

This paper cites A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.423021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.423021Z digest=sha256:b7560e186fb06fe154cf016ecb9ef4fd6d8b285be78159e9eddfc422b8b7bd59

Observation 66186c82-d55c-423e-96fa-50548104765b · outbound

This paper cites Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.522766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.522766Z digest=sha256:084185b409eb3cdfac094ba69fcba3e1b973e3acf017ec1cbcf55594b210bc6e

Observation 9942e338-8dd3-41aa-b0c4-7e0716be7eab · outbound

This paper cites Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.592961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.592961Z digest=sha256:2f7742dac05ad29ce61b6fe1a1f0c97786a30fe5412b2a88dabc56e12ed77cd4

Observation 469ee958-be37-46fc-967a-b552d5253e39 · outbound

This paper cites Cross-Modal safety alignment: Is textual unlearning all you need?.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Cross-Modal safety alignment: Is textual unlearning all you need?

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.658237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.658237Z digest=sha256:b50a360b80693523904a4a975eced13b62a1b1beacf53752e8cc538a5db07eb8

Observation 4e94f7f0-b9f1-4f6f-aa6c-9f44d050fd51 · outbound

This paper cites LLM-Fuzzer: Scaling assessment of large language model jailbreaks,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models LLM-Fuzzer: Scaling assessment of large language model jailbreaks,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:28.055383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:15.727430Z digest=sha256:77d3c8ee5c31733764c1d11bb25922a9f0bb2b3f02acee19af0ebb55a5a0854f

Observation 12fd0605-b6cb-4cf2-98c4-ec50ad46269e · outbound

This paper cites Qwen2.5-VL Technical Report.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Qwen2.5-VL Technical Report

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.790380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.790380Z digest=sha256:23f62b9d3040146201d90b4bfa118728ad48a3ef10484c313796715255e260f0

Observation 584eb1e0-8a8a-4015-bf63-db8eddbf9bf4 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.831513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.831513Z digest=sha256:a980ef060365b2cef9a7c898164628df2bc3233d31b9ada84256242dd66944f8

Observation 5c3b4aee-13d0-4b6e-8495-7dd0a6489a59 · outbound

This paper cites How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:15.950936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:15.950936Z digest=sha256:d6be454049e6472756874754dd4e812c63209977aa78ee8b0807bdd36b807d36

Observation 44b720f6-b940-4a8e-bf8f-7a927eaee84d · outbound

This paper cites InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:27.839847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:15.999360Z digest=sha256:a387184c2a41f806c09a5b0639a2f1a1de8c6af147faf2bf189bc37debbea1c8

Observation 5c6bafc3-e54b-41de-865c-cacaf0f26551 · outbound

This paper cites ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:27.724643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.053985Z digest=sha256:b2403d8d334977540ea394180fc483f1a4a1685479c312e63df9b7590ce45263

Observation 9a3db7f5-09ba-44fc-89ea-b2b29b711365 · outbound

This paper cites CogVLM: Visual expert for pretrained language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models CogVLM: Visual expert for pretrained language models,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:27.601596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.129480Z digest=sha256:5ff5efc3c7c432e51014184fde843414803adfbf32f782ce446359354f273eee

Observation 88ca9d66-a048-413d-8a7c-94986e8adccf · outbound

This paper cites Improved baselines with visual instruction tuning,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Improved baselines with visual instruction tuning,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:27.479504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.202791Z digest=sha256:51b0cc1c78fbba64775a0fe3604841ee2093360af3ad9a771c5d3ba53ad8ce7d

Observation dcb64f2c-9b35-48e2-8990-2a95b70739df · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.297715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.297715Z digest=sha256:6e0a0aae36d0bfb0f52d70ddc59d7617cfa58dd7896d53b6232ae8a78ec4718c

Observation bae5c4d4-73f8-4885-93c2-c8d5a8e0b41b · outbound

This paper cites VILA: On pre-training for visual language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models VILA: On pre-training for visual language models,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:27.243892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.356130Z digest=sha256:fade910e674708eee5a3e5c7dd27eacf3fdc7fe48e4e18f6fba42ab2470bef9f

Observation 1b70f732-d3e6-4a73-8736-eecd3ef6a7f5 · outbound

This paper cites NVILA: Efficient frontier visual language models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models NVILA: Efficient frontier visual language models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:26.979657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.414373Z digest=sha256:56f3619a3b0a3529c71ab785e4ea3fffcc4e8c4c48a0e08699934dc189eb1baf

Observation eab92bbe-8d41-4d25-9cb5-19608c97392f · outbound

This paper cites Scaling rectified flow transformers for high-resolution image synthesis,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Scaling rectified flow transformers for high-resolution image synthesis,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:26.734339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:16.486253Z digest=sha256:d3b5f42e635a8170206e2f386cc40653f14e23b793651522470257962ccabe0e

Observation 58d6533d-1d97-4cbb-9e42-89d1ae3c0367 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.552545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.552545Z digest=sha256:893fe71e32a6810653e49d288e9de81b08708aa7c6fb1400f200879273663f6a

Observation b78774f6-cb58-4c3e-9367-9c11b0d1f465 · outbound

This paper cites Visual instruction tuning,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Visual instruction tuning,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.637934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.637934Z digest=sha256:85df35bf96b00722cf85163a5fea43d4301951c2a8f39faeefc709bfee2bea5a

Observation ac976ac2-e652-4067-b122-99dc91ce8491 · outbound

This paper cites Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.718554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.718554Z digest=sha256:1393d8f00bc0dddb3b748f7c770720ca5e40c41d1f77f7567a96d3acf46e85e7

Observation fe0f0a71-571a-48fb-be9b-dc635c57f7cb · outbound

This paper cites SafetyBench: Evaluating the Safety of Large Language Models.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models SafetyBench: Evaluating the Safety of Large Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.805123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.805123Z digest=sha256:86cec507ab2912019d04e02e6822ff686b7bb0db1804a3d61207a3e809db35f2

Observation a83e0c6c-d4cb-4578-aa51-2c54070e2d61 · outbound

This paper cites R-Judge: Benchmarking Safety Risk Awareness for LLM Agents.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models R-Judge: Benchmarking Safety Risk Awareness for LLM Agents

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.892095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.892095Z digest=sha256:ec7248f36e8f45fb65e743323e3d382bad05688d1cc31b754c08e2221fcb7f3d

Observation 94b3aef8-1d9f-4329-9fb6-cde640ea49e5 · outbound

This paper cites HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:16.955465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:16.955465Z digest=sha256:96fcf5e4d2964c785090aeeb0e1d9c2b1c8bce72fd323fc6dfbac4431d692e77

Observation 59f00c4c-c6f5-444f-90d6-ac3def44a7d3 · outbound

This paper cites B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:17.045515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:17.045515Z digest=sha256:d62043d203e4cb9924d42e873903c827ba60acbdaaa38bbab782b1879ea30350

Observation 3b2999f1-0081-45a8-8d5a-cf96aa11acf1 · outbound

This paper cites SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:15:17.144248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:15:17.144248Z digest=sha256:1dbcee03207f44c5c66d5c0fad0a942fcf419a9571e48e6758bfa42490941079

Observation 2b5040a8-d1ac-4361-bbbe-a32493985afe · outbound

This paper cites Microsoft CoCo: Common objects in context,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Microsoft CoCo: Common objects in context,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:26.458441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.243211Z digest=sha256:f0ffa5bcef0400c0d491c23f43e6f3eda012bbc48a75c73dcf31fd8dfcc89786

Observation ede9c498-04e1-48dd-98ed-376afa6925ba · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Laion-5b: An open large-scale dataset for training next generation image-text models,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:26.197086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.321821Z digest=sha256:5395e75c9d363898ccf2902ed6a6f2723854227fb1c8cabc5400583257af568f

Observation f2d3928f-b10f-4c40-9cff-96e6c280a641 · outbound

This paper cites FigStep: Jailbreaking large vision-language models via typographic visual prompts,.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models FigStep: Jailbreaking large vision-language models via typographic visual prompts,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:25.942318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.397397Z digest=sha256:a3d0c754dfd508dcce0d0ab8a50467824f3b6b02213846cd4eeecbb16b3c3e19

Observation b956f090-6f6d-4986-8930-bd19d7a3974f · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:25.637777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.515477Z digest=sha256:cdfc055730dbff8ed2fb82af56414740396a0c0f7db06905c83f6ec188415c2e

Observation fa473ae0-59c9-4aa4-9336-2b3a22132fa8 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:25.410682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.611024Z digest=sha256:1790aa745bb1e7f7579bc321715aad41e2e35ee50fb06b9c83586b70de5fd1f2

Observation e5da0302-eb48-44a4-abc2-523e3918c645 · outbound

This paper cites Here are some examples: Example 1: [Input] First category: Personal Rights & Property Second category: Personal Injury [Output].

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Here are some examples: Example 1: [Input] First category: Personal Rights & Property Second category: Personal Injury [Output]

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:25.249072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.735545Z digest=sha256:9757f6b8c347bd37e1920476b7e085635b6d485a2a46f54eef18a845599e5182

Observation 94ef1918-e658-4e43-a043-7669baf90735 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:25.040165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.831790Z digest=sha256:386f7116aad3f593df4efa7314c4cc26f9c6a3167f25a92c1cf9fee18b5a16d6

Observation ad843633-ab21-4b7f-bd3e-fb2875175471 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:24.882679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.927881Z digest=sha256:59883c3c438b79b07bbeb4baa2b772fd03b222e08a058d5b167edf9279235795

Observation d3ea8b28-4da3-4a95-ab07-ce9553293b23 · outbound

This paper cites Example 2: [Input] First category: Network Attacks Second category: Phishing Email Guidance [Output].

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Example 2: [Input] First category: Network Attacks Second category: Phishing Email Guidance [Output]

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:24.682441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:17.996337Z digest=sha256:3a706bbd848d1c81ba08fd70477a2a1a0afd46b82635eb16ad85e931d7b6435c

Observation dca17653-ee8d-4f23-9f22-ab31e5e092b6 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:24.541842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.083757Z digest=sha256:9ce44ee0b38267af2ba6c7ba4313313938c30494118a93c9f095818ca652ce18

Observation 9dd61599-8aa1-4187-99bc-3c49b3876be7 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:24.379352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.185376Z digest=sha256:844c47498a1667598b0ce5be0c0d532fe913863126e03e46b108aeb487f1b362

Observation 1a42226f-ce5b-466a-a8cf-40bb3f21bc26 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 60

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:24.171243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.288501Z digest=sha256:2a5e583d8fae887915c9050ba496de93588ef0248c3259d4e62a484fa458ace5

Observation 26ba96af-471e-4cc5-9675-0a732226f923 · outbound

This paper cites Or, the image should detail depict some harmful objects.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Or, the image should detail depict some harmful objects

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:23.994776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.365255Z digest=sha256:7a705d47751bca84966793d2327c8cefc8f3fe198c5b15b6a2f884002f111c7f

Observation 22301e9c-2e12-40bb-9136-b0e222440405 · outbound

This paper cites Make sure that the harmful queries should directly or indirectly lead to harmful output.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Make sure that the harmful queries should directly or indirectly lead to harmful output

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:23.815050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.442533Z digest=sha256:3abe94e58ac5f1f2cbe0f3ee29aefece13afef8829219da71966667423a722bc

Observation a16ed69f-4346-41dd-8999-1e5aae0d9010 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 63

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:23.636609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.523345Z digest=sha256:da0ea5c89f88e872ee23a8b5fe3e0352733d05a65c8da0d4c15942d7010c1c94

Observation bdd5bb1d-1f55-48df-824a-7013cf967b9c · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:23.429985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.569920Z digest=sha256:f635b114887526dd5cb816fa339ef96df51b2ccb9da62643e0cacdfc3e34a8a6

Observation a1d4ca31-1a26-4ef5-84ef-cd69dd24cc82 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 65

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:23.214665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.655979Z digest=sha256:8365cf8280d5f1967529b356b7edbfa983f4ceec1bd1c2bd87b58e1a6aa793a7

Observation 1b7c69d1-b984-46c7-9580-167935410044 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:23.020126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.749821Z digest=sha256:e2964be5be71721644319b6bfcb996b54b5386d5180b3df097ce5b8c44d40d8a

Observation 1c9998c3-216a-44bc-b285-0313f8eb3704 · outbound

This paper cites Then, you must provide an explanation and a refined T2I prompt.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Then, you must provide an explanation and a refined T2I prompt

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:22.869712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.856740Z digest=sha256:b55b33e648088efe7f40e51809cf41203f0dcc5a34cc5226d7ce772ab062191a

Observation 79e2d5de-9e56-4ca1-aebf-cc1c170b0d05 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:22.778346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:18.987758Z digest=sha256:d406db58bc1289a2447e9f70627e97b972a5c0a1a368524108b74234be5ed5fc

Observation 197402b8-de20-488d-9b95-3c6f18e7c571 · outbound

This paper cites marijuana.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models marijuana

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:22.619380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.137173Z digest=sha256:1b3f307aeacc19d66cbbda897689076d9f4b4549d3653b46d2f64b35c2467752

Observation f739252a-cb13-409f-a6fb-bd398ffda537 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:22.433160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.282724Z digest=sha256:d3d0940bf8871bb5282a9ec004da4e2f177e6c9639f05fe2a31f0da08a8f66de

Observation d50a1a3b-5bfd-4b08-bcd5-6bc925bf0d2b · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:22.222796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.399954Z digest=sha256:ebe0bd5b97bad9508a20f225296e879b1de3b42a33d77b64e29f4360b7a438c6

Observation 9111cf0a-86a5-4f5b-8581-c888f631294b · outbound

This paper cites Refusal includes responses that only offer alternative suggestions without answering the original request.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Refusal includes responses that only offer alternative suggestions without answering the original request

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:21.992660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.537033Z digest=sha256:d615d3ec852615dce64f83b7674e7c8644a221ea39d70110d7575f4a30bb9829

Observation e45eb8fa-4eff-45b9-903a-9959fbb7e410 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 73

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:21.837203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.651577Z digest=sha256:5bdb1fa54ad9cb240ac595286843a63d67a1d9492e34d49a2c745348cf789d9a

Observation 0804baef-0860-4e33-8d82-5fe5d901b186 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 74

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:21.689030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.802045Z digest=sha256:d9dd1bb72b2cf1844e977d982ff61db44ad6c10a60e8a7b340f31a4b2de88dc7

Observation d3f2d60a-285d-48b8-8f63-e9c9d07f3c45 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 75

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:21.552026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:19.974078Z digest=sha256:9b1e8bebe2475e2719669782f27d12ff7676aa06fb75384e4c309344df27dd60

Observation c53906c0-5c64-4d72-8e95-d81b323c91e8 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 76

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:21.448870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:20.093366Z digest=sha256:f18d52c43812d180dc5880a37cba455399c9eda78903908cf6af751c408e6083

Observation 2a7d2394-9dc0-4a7e-a325-2b1eea3fae89 · outbound

This paper cites an unresolved cited work.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Unresolved cited work

Reference 77

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:15:21.349871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:20.248628Z digest=sha256:43059b95e80e71d837c3f91cdba6151174634c7a903513c2639388117dbe9f59

Observation 68d3c54a-bb21-4428-90d5-6caeeeb18a6b · outbound

This paper cites Text Harmful.

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Text Harmful

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:15:21.144701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T14:15:20.372542Z digest=sha256:936a26a79787408deb26c6fc9940b2cff09668f3d250d275b662c88d9d9d8cf9

Pith citing papers

Observation bf60bcae-3289-43d1-9642-c2c0cab2c925 · inbound

SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems cites this paper.

SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-11T06:31:02.127072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T17:36:19.694339Z digest=sha256:87a5d11a7e0f4d3f3f90dae1c316ebfaedfc0af7f07d53d6357cebb3416fa3b2

Observation 8ca0d28b-5903-48c7-a60a-e93e6ee7f1bd · inbound

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety cites this paper.

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Reference 194

Resolution
verified exact
arxiv_id, observed 2026-05-11T12:46:05.639870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-10T03:00:34.862711Z digest=sha256:5b12512e15c0a6f490c6b4cfdda15ba560b7f9c214b427fd9bc37043b2d3d2ec

Observation b9999ff2-1afe-4dd8-840e-cac435d6fb01 · inbound

MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation cites this paper.

MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-06-28T20:42:37.979654Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T18:20:43.092561Z digest=sha256:ec81d6d2ef164c08ed4a75efd71a06564e6d96f3c07efc7f244ab9570fade584

Observation 102e5780-ec6b-417b-895e-a62c1dd7e942 · inbound

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics cites this paper.

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:37:14.923132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-27T21:55:48.561400Z digest=sha256:8f94221686cc2ffc8dea7c4c699f57f0d450e92bdd95380c5095b6ef06e68972