{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99216d1b4ed076877861cbf41a1019aadcb8d95445e8fde2f3b404be8935d0c7","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:08:12.831013Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:39:34.092556Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T12:39:34.185319Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"cited_work":{"arxiv_id":"2507.20994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.20994","snapshot_observed_at":"2026-08-05T12:39:34.185319Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","venue":"cs.CV","work_id":"df917c6a-073b-4910-978e-463089dfee85","year":2025},"citing_paper":{"arxiv_id":"2509.01414","last_updated":"2025-09-01T12:11:42Z","snapshot_observed_at":"2026-08-09T07:45:25.479566Z","submitted_at":"2025-09-01T12:11:42Z","title":"AttenTrack: Mobile User Attention Awareness Based on Context and External Distractions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:39:34.092556Z"},"links":{"cited_paper":"/paper/2507.20994","citing_paper":"/paper/2509.01414"},"observation_digest":"sha256:6cdcd1e371b92a305c3cbcf59dd78dd7c0555d519a30ba678e63da5675143353","observation_id":"49c672e4-141b-47b7-a04c-c29148d1fdd9","resolution":{"observed_at":"2026-08-05T12:39:34.200846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20994/citation-record","integrity":"/paper/2507.20994/integrity","json":"/paper/2507.20994/citation-record.json","paper":"/paper/2507.20994"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:08:07.970072Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:07.970072Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:9e50b3b7c3e0e81a4f83212bec86b4da9101c82b291f43340cc8b6c0b8fed0b9","observation_id":"0e6a83ea-ea1e-47ec-b23c-9ca53f94cf26","resolution":{"observed_at":"2026-08-06T13:08:07.970072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.748683Z","title":"Nsfw image classification - resnet50","venue":null,"work_id":"77ad2a49-2f6b-433c-83f8-dc79d8a0a082","year":2020},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.113189Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:fd1eca6ed786fab6c4871078a4fcee70f5031a7895f0c84975965667087e9032","observation_id":"5263691d-3b1f-4608-b5ab-8d8735dfa6e2","resolution":{"observed_at":"2026-08-06T13:08:15.759539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:08.282747Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.282747Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:9c015b0b3d39606780288517cb5e0d8426ed2754817437036d5fc049f7b76c40","observation_id":"2bf3a9c5-6aeb-4a5e-b6aa-255e719081b6","resolution":{"observed_at":"2026-08-06T13:08:08.282747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.679128Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural language feedback","venue":null,"work_id":"07eca7cb-ea93-4d66-b7ff-4f4a5886a5eb","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.419152Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:edb011c0ff9bef4dbc4caa4b70c6304191e4c1c2b68f4d95db1870614943f150","observation_id":"fd1127be-6612-48af-9883-3652bffc30fe","resolution":{"observed_at":"2026-08-06T13:08:15.691502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.631628Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural language feedback","venue":null,"work_id":"656523ac-1277-47d5-ab17-80bfeed2ede1","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.537842Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:6a26f7fa613079c8901a03fbb82818e7959e389413d4caaa85d774f01780490e","observation_id":"0e8caeda-72f3-4a8d-86ce-32eefff1208e","resolution":{"observed_at":"2026-08-06T13:08:15.638904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.596027Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts, 2025","venue":null,"work_id":"5b8c998b-f702-4fe9-9a64-165a62d3734a","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.667698Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:4519ee661328498ba5134552fb43ad7a3d6fdcc126be011aa7750e452edc8631","observation_id":"29f6bec7-9357-473e-b77e-73fb643c213d","resolution":{"observed_at":"2026-08-06T13:08:15.611989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.547379Z","title":"Kwok, and Yu Zhang","venue":null,"work_id":"33441cf8-fb1f-4bcd-89e2-439639625a66","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.799839Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:0e9e356c251fc5574e8c728e2ce8a9ff46793fc843c5ea930a81f78365e3342b","observation_id":"6f009ae5-4aed-49c8-81e7-059ddedc41cd","resolution":{"observed_at":"2026-08-06T13:08:15.564633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.507411Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"d3535285-c9f7-4cef-a971-fdbbf8bf9d7e","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:08.955131Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:5020b352205366d10c0ce34c6439553a37976859a425e1fdb388d041836ee035","observation_id":"4c306b2b-0353-4974-bc45-3cfc213e2d8c","resolution":{"observed_at":"2026-08-06T13:08:15.514951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.470875Z","title":"Minillm: Knowledge distillation of large language models, 2024","venue":null,"work_id":"49676ec1-d0c1-4835-ae0d-add53ecff059","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.125235Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:aead140d4d8f4d582724c676080bc23a95a27c5503844be57ece602c71f6d2a0","observation_id":"cd236861-ab83-41f5-b7c9-7d6dc4e51e35","resolution":{"observed_at":"2026-08-06T13:08:15.478924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.438353Z","title":"Hod: New harmful object detection bench- marks for robust surveillance","venue":null,"work_id":"0772a7a8-3bb2-4b6e-bfa3-0e0937ecee49","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.260850Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:038d7e2bc161c1e3c8a6e22e41d8df08f3d2653b626f247cd93395b4ea8b741f","observation_id":"5da337ee-3c4b-4ecf-9e24-c3550b3b57f1","resolution":{"observed_at":"2026-08-06T13:08:15.447088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.393047Z","title":"Tit-for-tat: Safeguarding large vision-language models against jailbreak attacks via adversarial defense, 2025","venue":null,"work_id":"d82fab3a-efde-44a4-8127-2ca2b120c471","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.417776Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:6d233a5096fae276da1c0a79f56099eea0b73e235757e241400141f3a90bc56a","observation_id":"5ca6a6b8-5bcc-41f9-8cd9-cd37f023fa1a","resolution":{"observed_at":"2026-08-06T13:08:15.404207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T13:08:09.558348Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.558348Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:1be4687dc8c1d0a1a376ed6c8f9d240cfaeb677cd34b0f636473e17a8545a672","observation_id":"82d02209-c09d-4a5a-8fb7-3b6aa91ff044","resolution":{"observed_at":"2026-08-06T13:08:09.558348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:09.713335Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.713335Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:551850af03b9ffb83868fcf04fce28427b8a7ab5f900411c0acb17d1b18ea092","observation_id":"7cfd07e9-3a9d-49cf-92b7-2b773eb2f09d","resolution":{"observed_at":"2026-08-06T13:08:09.713335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.335091Z","title":"How does vision-language adaptation impact the safety of vision language models? In The Thirteenth International Conference on Learning Representations , 2025","venue":null,"work_id":"bb09f2c4-5551-4bec-bb6d-c183f5368146","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.833781Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:b6dcfde69f50a8cc8c8884834b9b49a443e310b0c09935b65963ae0a93256a1d","observation_id":"2a8f6234-e0a8-4430-82e7-ca8bf4d5aa62","resolution":{"observed_at":"2026-08-06T13:08:15.343970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:09.990842Z","title":"The power of scale for parameter-efficient prompt tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:09.990842Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:275f3cf24e189092e1dad0e53a775a6c2694ba49b04cdbb4570dd0cf78ffa436","observation_id":"3b407513-0664-45b2-a636-cfe885dd8e0f","resolution":{"observed_at":"2026-08-06T13:08:09.990842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.264862Z","title":"Safety layers in aligned large language models: The key to LLM security","venue":null,"work_id":"b9612cc4-279b-4848-bcc6-8db39bad2258","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.132652Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:52a057d7835e2c514b2eb7899e16ced6820adb8266e2c5a88632c1828abf7a3d","observation_id":"1e2c534b-5423-4894-9d18-ecd049330485","resolution":{"observed_at":"2026-08-06T13:08:15.276560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.210533Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"952e0441-c427-4b98-a16e-10fda000dc51","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.279911Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:7afcc95c10fb6feba24610d3af1121711475daf2342ae34e92de6c541f490219","observation_id":"3a7b1f9e-11a3-48a7-b605-40a8882b7f89","resolution":{"observed_at":"2026-08-06T13:08:15.223607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:10.434724Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.434724Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:9e41e15de7e4f25ef63a74df7da915107cdc19d2c6d3272f473174180fdaecdb","observation_id":"5f894fe9-b69e-4408-9a96-43d0a5efa368","resolution":{"observed_at":"2026-08-06T13:08:10.434724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.121912Z","title":"Query-relevant images jailbreak large multi-modal models, 2023","venue":null,"work_id":"25c76f0d-e678-4cc1-b090-8ac70621d15c","year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.544261Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:12394c9c3420e14aa616cec2b6874fa82aa8c8eff075a4d176366ce43cb691fd","observation_id":"70aac814-c1a7-4aee-9e10-55cf9f793213","resolution":{"observed_at":"2026-08-06T13:08:15.136590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.083002Z","title":"LLaV A-1.5-7B-HF: A hugging face implementation of llava-1.5, 2023","venue":null,"work_id":"c4fb2c48-b1d5-4ee1-ab97-1aa71b8963d4","year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.675074Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:88a15ebd728f5f4b6f4afcedb77837995db27ca45843d866cdd9252ee05feb60","observation_id":"6496eb7c-0bfd-4701-a4e2-d5c236b491f4","resolution":{"observed_at":"2026-08-06T13:08:15.096758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-08-09T07:44:02.172714Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-06T13:08:10.816109Z","title":"Teaching small language models to reason","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:10.816109Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:71c36802e3a3fce6a6dbda0254f1986cc4047f588ee147ecea211c30fed20a9b","observation_id":"b122cbaf-335a-4c4d-a187-8921207f7443","resolution":{"observed_at":"2026-08-06T13:08:10.816109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.041663Z","title":"Llama-3.1-8b-instruct","venue":null,"work_id":"c3c68927-ee6b-4230-9933-a18f5b716a01","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.020043Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:efa48477cfb212b0282ff88b1951ab4fd2acfdac9361d22504b20ab639c30606","observation_id":"0b49f981-2b79-40a5-9653-303d7eac9bbc","resolution":{"observed_at":"2026-08-06T13:08:15.061543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:15.003316Z","title":"Llama-3.2-11b-vision","venue":null,"work_id":"4c1e077e-4ad2-4ec4-8533-da253c47272e","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.157787Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:6aa9ff5d7db9bf484942091802ed830301d36b6c9c6a28903da6b22026b096e9","observation_id":"d20209e9-fe38-432a-9f4e-512a34e25187","resolution":{"observed_at":"2026-08-06T13:08:15.011634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.963051Z","title":"Mllm-protector: Ensuring mllm’s safety without hurting performance, 2024","venue":null,"work_id":"bb4aa557-2c7e-4bd6-85ba-1e264e795219","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.282244Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:fc7916bb8880adc8f94a5991a4d5757c2fb3dd4397a92d0166fee6a748f35049","observation_id":"e4e6040b-5faf-423c-b10d-b64d1f3a369d","resolution":{"observed_at":"2026-08-06T13:08:14.979492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.926117Z","title":"On the adversarial robustness of multi-modal founda- tion models, 2023","venue":null,"work_id":"66c447ef-0e16-4c94-826a-6e2c15b187a8","year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.409496Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:28052a22a4dcb8df60641d446d7a6314b8856d553376c0bdd6b9213eaa5c48aa","observation_id":"adbe6d75-52a0-43c2-bda7-f7c45df8c2e7","resolution":{"observed_at":"2026-08-06T13:08:14.935397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:11.602594Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.602594Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:e32db73be27d8d03a3d8cd05f07d342468c8d4c548b412720f24e5b0255bb05a","observation_id":"ae78b573-875b-46df-9dfe-fef82f42e37e","resolution":{"observed_at":"2026-08-06T13:08:11.602594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.841810Z","title":"Enhancing visual- language modality alignment in large vision language models via self-improvement, 2025","venue":null,"work_id":"4ff1bfd9-8de8-4b93-abec-9014ebacdd35","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.732765Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:6d73b88a518ed703a0f0f899a05d9e446d4404bcdcaa9987ae4dd440a35d923e","observation_id":"b4822526-2719-424d-9270-b19f593632e7","resolution":{"observed_at":"2026-08-06T13:08:14.855388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.640374Z","title":"Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting, 2024","venue":null,"work_id":"e2db4185-c8fd-44b2-b3e9-445a041f7c22","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:11.891498Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:fcd7234fbbd28eca27dace3f10682febdbc0dbfa38c1613e60e7214d8c19e92f","observation_id":"8ce74b3c-a356-42ef-b44d-4c30712b93f9","resolution":{"observed_at":"2026-08-06T13:08:14.709567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.468471Z","title":"Break the visual perception: Adversarial attacks targeting encoded visual tokens of large vision-language models, 2024","venue":null,"work_id":"c4c76f2f-e0f7-4171-b46a-52979758efd7","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.006024Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:cd0e9b7c8d2017a44c9c3eebf101e83ffec20c2c9a32e4b6417134f9911650e0","observation_id":"7202e27e-0e35-49fe-ae72-7dd44a84419d","resolution":{"observed_at":"2026-08-06T13:08:14.537513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.274451Z","title":"Tracking the copyright of large vision- language models through parameter learning adversarial images, 2025","venue":null,"work_id":"fb352c23-6c35-405c-9d8a-9d23fd7a3f42","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.113383Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:c7dcd61e93cf1b42a0dd1b1a40d73978153f20b4eb9779b8a59f7edb4c959855","observation_id":"6062bb48-0470-4ac2-a38a-8b50b33ebd12","resolution":{"observed_at":"2026-08-06T13:08:14.367214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:14.102396Z","title":"Cross-modal safety mechanism transfer in large vision-language models","venue":null,"work_id":"e75541f7-ff1f-45c9-a11f-9ab2e568a04e","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.200632Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:1c3e880a3c0d5c0a0b3e86776ec970f6ef1f0ad482bec6409504ae72e07d9db4","observation_id":"84638ac2-ac35-4fbb-a7d6-3be4b18fac92","resolution":{"observed_at":"2026-08-06T13:08:14.169471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:12.327395Z","title":"Jailbreak vision language models via bi-modal adversarial prompt, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.327395Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:4eec7d90ece69132caccde5d3722a5a16416acfcb5f09b2052971457a950f18f","observation_id":"f865ba14-4061-4fbc-8b6b-6962cc47e4e7","resolution":{"observed_at":"2026-08-06T13:08:12.327395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:13.855639Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"01a45f4d-e239-4dce-abf6-cfdf5f372400","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.471484Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:7e3dabc4b162ab9b2eeb2aea8d999b560b16cf95c469e0c75f66ff7b3500bfab","observation_id":"3edd9714-00d1-4dfb-8e71-886cf0655dbe","resolution":{"observed_at":"2026-08-06T13:08:13.944111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:13.589263Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model, 2025","venue":null,"work_id":"eb3396dc-95ce-4094-b853-404a65c75cb1","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.594630Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:0321bc34792df813a2e3b08ee1e779a832d7be5889a266293f1f3c1db1a1250f","observation_id":"5687ac9e-8fe8-4b9b-b862-b0331c550fe4","resolution":{"observed_at":"2026-08-06T13:08:13.723508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:13.318716Z","title":"Spot risks before speaking! unraveling safety attention heads in large vision-language models, 2025","venue":null,"work_id":"10d4aad6-9c0b-4086-929b-15c28e33100b","year":2025},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.715535Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:94088817b18741df443d9eb3c569e612f3cc4de4dd73ea236f88c01aedb2e219","observation_id":"9076cfd6-99a8-4cf9-90f9-fde995bfeafe","resolution":{"observed_at":"2026-08-06T13:08:13.441026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:08:13.181539Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models, 2024","venue":null,"work_id":"8c172dc4-faf2-40d3-abc5-e301ec267959","year":2024},"citing_paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:08:12.831013Z"},"links":{"citing_paper":"/paper/2507.20994"},"observation_digest":"sha256:3f1760c1337396d845b990914f7467a1daeaa1c432536a7dc40e51df928a8a23","observation_id":"6f2ef598-1eb0-4c9f-9549-961c4b254f65","resolution":{"observed_at":"2026-08-06T13:08:13.261051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20994","last_updated":"2025-07-28T16:59:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:21:03.557630Z","submitted_at":"2025-07-28T16:59:53Z","title":"Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2507.20994."}