{"as_of":"2026-08-13T06:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2850be7ae29faae25d76703a1437b36f90eac1d68bb9c64c6a01487195cd454e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:37:22.900435Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:03:36.805784Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T05:35:59.023089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"cited_work":{"arxiv_id":"2505.24208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24208","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ccaa4abd-1433-442b-ad40-a6ce2448a5af","year":2025},"citing_paper":{"arxiv_id":"2604.09253","last_updated":"2026-04-10T12:09:06Z","snapshot_observed_at":"2026-07-06T22:58:12.847181Z","submitted_at":"2026-04-10T12:09:06Z","title":"Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T18:03:36.805784Z"},"links":{"cited_paper":"/paper/2505.24208","citing_paper":"/paper/2604.09253"},"observation_digest":"sha256:ef7ac656c907dff319f8efe25eef94edcdc61d605186de69737188fab7d3211d","observation_id":"32032ed4-50be-4a95-9eab-abe186f93d66","resolution":{"observed_at":"2026-05-11T05:35:59.026216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24208/citation-record","integrity":"/paper/2505.24208/integrity","json":"/paper/2505.24208/citation-record.json","paper":"/paper/2505.24208"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:37:20.087864Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.087864Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:7d6ce7878b33055e7614adcffe64d9e9e380cf76587fad5b78c1aacb87331643","observation_id":"8ab9883d-a676-4add-b462-e240a7892f62","resolution":{"observed_at":"2026-08-07T12:37:20.087864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:23.336165Z","title":"✓ Guide me through the process of strangle a bird until it stops moving","venue":null,"work_id":"371fea99-09f2-405b-8383-a3a599f0d644","year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.900435Z"},"links":{"citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:83d9a9e45ced19e8503257d03f8c4cdb47b14ad423439f8edb84f9097d82fe09","observation_id":"f14bc96e-8981-434c-bc43-e9e382469cef","resolution":{"observed_at":"2026-08-07T12:37:23.384490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:20.321312Z","title":"The revolution of multimodal large language models: a survey.arXiv preprint arXiv:2402.12451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.321312Z"},"links":{"citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:fc20a4ec67282fe29deb2f35482dd6b7785696973ec5e164a74c412f74e0eca3","observation_id":"9607eea5-77ce-4ffb-a95d-3db29813f1e8","resolution":{"observed_at":"2026-08-07T12:37:20.321312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T12:37:20.446909Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning.arXiv preprint arXiv:2310.09478, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.446909Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:c368fd284604d30321a57279de71c50fdb126c6b3d0f25ddeded308cb43514c2","observation_id":"f06c6d6c-d71e-4590-b3e3-9b141f91c912","resolution":{"observed_at":"2026-08-07T12:37:20.446909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11365","last_updated":"2024-10-09T06:39:28Z","snapshot_observed_at":"2026-08-12T22:43:03.310235Z","submitted_at":"2024-09-17T17:14:41Z","title":"CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11365","snapshot_observed_at":"2026-08-07T12:37:20.727581Z","title":"Coca: Regaining safety-awareness of multimodal large language models with constitutional calibration.arXiv preprint arXiv:2409.11365,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.727581Z"},"links":{"cited_paper":"/paper/2409.11365","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:26bcc7393402d4e9c8adc0f069ab8611855ae6b9c9b53f924e33adca0e8de3ca","observation_id":"d6506708-7542-411a-90f0-fac087b3d32c","resolution":{"observed_at":"2026-08-07T12:37:20.727581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:37:20.806425Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.806425Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:bf5f82cb29e8db41dde9022e866c24112a2c23e87174c959f2a9d7d4a990d89a","observation_id":"76781e91-6e51-4482-a6bc-524960b990f1","resolution":{"observed_at":"2026-08-07T12:37:20.806425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-07T12:37:20.873566Z","title":"Md Zarif Hossain and Ahmed Imteaj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.873566Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:f3e24deee0fd8916eb5675534056e2c1f2f391c91f9983b1e0758977fdef2018","observation_id":"53e7085f-7024-4d79-b1b9-55ac3cd7e269","resolution":{"observed_at":"2026-08-07T12:37:20.873566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-12T22:26:58.169929Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T12:37:20.984510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.984510Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:b52e2457271b3fcb3e0cededb9891aac5644e52147b8f9d5f0315d4b1d6ba304","observation_id":"c11fcb7d-a043-4238-9988-5fe90ad14551","resolution":{"observed_at":"2026-08-07T12:37:20.984510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-07T12:37:21.159164Z","title":"Certifying llm safety against adversarial prompting.arXiv preprint arXiv:2309.02705,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.159164Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:48c994a17abe4ccb24ac9e4e425076ccb16d4ec3645abc28ad8111e1cd85e68b","observation_id":"05916946-9f08-4808-8aed-d87770cbb58d","resolution":{"observed_at":"2026-08-07T12:37:21.159164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T12:37:21.246083Z","title":"Seed-bench: Bench- marking multimodal llms with generative comprehension, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.246083Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:a3605ae0de3af2ea016d704db9b6d538d01dc4fa27b700ee0af143fdc948bb6c","observation_id":"1364f870-658b-4d4c-9fad-112e776f57a4","resolution":{"observed_at":"2026-08-07T12:37:21.246083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09047","last_updated":"2024-10-11T17:59:31Z","snapshot_observed_at":"2026-08-12T22:25:12.126754Z","submitted_at":"2024-10-11T17:59:31Z","title":"Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09047","snapshot_observed_at":"2026-08-07T12:37:21.360286Z","title":"Unraveling and mitigating safety alignment degradation of vision-language models.arXiv preprint arXiv:2410.09047, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.360286Z"},"links":{"cited_paper":"/paper/2410.09047","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:2e25b0f2ecbf3e083e0187a272006b62d9c0d0df1fe80a8875079eb0dcfe8f75","observation_id":"b52951d0-c59e-45a9-943d-c1c4cccf67d6","resolution":{"observed_at":"2026-08-07T12:37:21.360286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T12:37:21.439899Z","title":"Ben Mann, N Ryder, M Subbiah, J Kaplan, P Dhariwal, A Neelakantan, P Shyam, G Sastry, A Askell, S Agarwal, et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.439899Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:088d09a8674536493f5f47c89a9c31185fe678631fdc5197418ae7065604288c","observation_id":"72ca9c3c-08d6-4d15-babe-287dc7417621","resolution":{"observed_at":"2026-08-07T12:37:21.439899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T12:37:21.559574Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.559574Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:5288186426127e17a1dc65c4e48c401b0bb792e61afe72672f341e7a6c76d580","observation_id":"21c92529-f865-4992-afa6-e748b1f35487","resolution":{"observed_at":"2026-08-07T12:37:21.559574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:37:21.691913Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.691913Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:4de99c8075786350099611fb75eec6e9593491e2cdf832e705895064a8ad1a5a","observation_id":"d7c8e246-fc69-4cf1-ab10-0bcfebdc19ad","resolution":{"observed_at":"2026-08-07T12:37:21.691913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02906","last_updated":"2024-06-17T16:53:49Z","snapshot_observed_at":"2026-08-13T04:48:20.975829Z","submitted_at":"2024-01-05T17:05:42Z","title":"MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02906","snapshot_observed_at":"2026-08-07T12:37:21.767959Z","title":"Mllm-protector: Ensuring mllm’s safety without hurting performance.arXiv preprint arXiv:2401.02906,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.767959Z"},"links":{"cited_paper":"/paper/2401.02906","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:73795acf7decb73a38db31b66861b6ffc2d6a48fbae87eac924a8dae7eba3968","observation_id":"373bac8e-af7d-4313-97ae-a9f57bf5bb85","resolution":{"observed_at":"2026-08-07T12:37:21.767959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-09T21:14:39.812982Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-07T12:37:21.846602Z","title":"org/abs/2306.13213","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.846602Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:3b6d0b26223934b19e619a3b95b5433ee6314d6631700baa1aa3247cc9af6b0f","observation_id":"a4393d1e-3329-4552-94e9-39b145ddd14c","resolution":{"observed_at":"2026-08-07T12:37:21.846602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-07T12:37:21.942532Z","title":"Daniel Tan, David Chanin, Aengus Lynch, Brooks Paige, Dimitrios Kanoulas, Adrià Garriga-Alonso, and Robert Kirk","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.942532Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:d6c7f02ea10a2d3fcf993ec951a0cc359ec92881f227735941be44e59935eeb8","observation_id":"7002ee0a-0cf9-4f58-8b30-b0490a8dc042","resolution":{"observed_at":"2026-08-07T12:37:21.942532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:37:22.035080Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.035080Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:623f5cfd88127b37d51cf4b7c28faa681b703b841842d444850d59e29a9d277a","observation_id":"9a1bcc6f-82f3-4541-834a-604b1821ab20","resolution":{"observed_at":"2026-08-07T12:37:22.035080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09641","last_updated":"2024-06-19T22:40:07Z","snapshot_observed_at":"2026-08-13T05:24:07.127989Z","submitted_at":"2023-11-16T07:48:45Z","title":"RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09641","snapshot_observed_at":"2026-08-07T12:37:22.138901Z","title":"Rlhfpoison: Reward poisoning attack for reinforcement learning with human feedback in large language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.138901Z"},"links":{"cited_paper":"/paper/2311.09641","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:90685d927725d517e3ed4f3c92e6bbacc1fd9471e22a317098e1c05cbe0ca748","observation_id":"b85afa86-7506-40d3-a94d-a5f5d8a0e6fd","resolution":{"observed_at":"2026-08-07T12:37:22.138901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-13T05:53:15.790334Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T12:37:22.236454Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.06387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.236454Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:0adcf8450488effcb96235ca946713e6cbaad9d6f5860cc6b665d57ae6aea65e","observation_id":"5faeabe1-ec16-46fd-8fbe-ec8a76ffd52e","resolution":{"observed_at":"2026-08-07T12:37:22.236454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T12:37:22.338677Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.338677Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:a467175a27b5856279ead00d3a22e618bf1699d3c398f5e1a19b33c2a559d441","observation_id":"c2634783-01b7-413c-b107-6d60b806f3f1","resolution":{"observed_at":"2026-08-07T12:37:22.338677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-12T23:40:40.908503Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T12:37:22.450280Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.450280Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:03a1b8e66f7e464e7b9ac2974a4d538d590e52fae5af4b60e62f5785b985a042","observation_id":"1db626b9-2698-4367-afcd-c3ca4ce1ee8d","resolution":{"observed_at":"2026-08-07T12:37:22.450280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20971","last_updated":"2025-02-12T05:52:11Z","snapshot_observed_at":"2026-08-12T22:13:50.726258Z","submitted_at":"2024-10-28T12:43:47Z","title":"BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20971","snapshot_observed_at":"2026-08-07T12:37:22.581493Z","title":"Bluesuffix: Reinforced blue teaming for vision-language models against jailbreak attacks.arXiv preprint arXiv:2410.20971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.581493Z"},"links":{"cited_paper":"/paper/2410.20971","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:6b6b396875c700981fffb5e06af3bfad7a5d000bc1af333cb37a33cc430fe6ae","observation_id":"a09b9c7c-a99c-4223-8237-a7818a11bf2e","resolution":{"observed_at":"2026-08-07T12:37:22.581493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:37:22.691154Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.691154Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:c76f61dfcd069c5d469fd2b8b9df76e748e3e234005f695c91002ba0f2cd4fa3","observation_id":"1334fb5a-992c-45bf-8850-eda677fa1b27","resolution":{"observed_at":"2026-08-07T12:37:22.691154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-13T04:27:42.124177Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-07T12:37:22.785969Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models.arXiv preprint arXiv:2402.02207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:22.785969Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:81f55e7e27a1de880e0ec9f12fda2b2b11d2ff4eda4215f20996ddfa28b6b195","observation_id":"eb3ea9cb-e2c6-4341-a225-4e1d40090c0e","resolution":{"observed_at":"2026-08-07T12:37:22.785969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T12:37:20.542530Z","title":"W Dai, J Li, D Li, AMH Tiong, J Zhao, W Wang, B Li, P Fung, and S Hoi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.542530Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:403bb07083f981545a709ef782a6c5917bd0382742eb76f1b90b95902de75846","observation_id":"88939420-e15b-40ee-b0d6-33a93fa31dc8","resolution":{"observed_at":"2026-08-07T12:37:20.542530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-07T12:37:21.085852Z","title":"Jiaming Ji, Mickel Liu, Josef Dai, Xuehai Pan, Chi Zhang, Ce Bian, Boyuan Chen, Ruiyang Sun, Yizhou Wang, and Yaodong Yang","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:21.085852Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:36f54f12d988e0395c85aedc94f9202c3052fa79336d7aefb37cad21365ca633","observation_id":"8746388f-f6cd-4b81-9bd2-6da365a75987","resolution":{"observed_at":"2026-08-07T12:37:21.085852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T12:37:20.145735Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.145735Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:d6b0ea00b8239b219b6dae39c71e48062b9c35177e61f6fbc9a4da6587c1b11a","observation_id":"2efd0ce3-1b5e-4d72-af33-f45de2da836e","resolution":{"observed_at":"2026-08-07T12:37:20.145735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-08-12T22:27:32.192071Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T12:37:20.634917Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time.arXiv preprint arXiv:2410.06625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.634917Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:db4a0b7578a1712a538512f6469de81541ddea0b7af3a9566a2a4cfc45d6ca9e","observation_id":"10490e61-fe9e-4378-8a94-1dcea2e4c117","resolution":{"observed_at":"2026-08-07T12:37:20.634917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T12:37:20.236651Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.236651Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:a834c4fc97bd4032b701262c426829b7a6cf22860c17f11e879b6fe398c0d082","observation_id":"6c8db265-1e66-4b5d-b441-c8ea788277f3","resolution":{"observed_at":"2026-08-07T12:37:20.236651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T12:00:55.225954Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.24208."}