{"as_of":"2026-08-18T17:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:024be26acae50cfa740ce45f1058768c58bf82911a34e6f41715c80868c81929","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:24:49.761179Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10513/citation-record","integrity":"/paper/2608.10513/integrity","json":"/paper/2608.10513/citation-record.json","paper":"/paper/2608.10513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.286087Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.286087Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:133668eafc0a11a0ec793a2df9abac89723b7ccc08135084301518c200c71510","observation_id":"6025fc5e-cb13-4b9e-a1f7-bcc2fbfedd4b","resolution":{"observed_at":"2026-08-15T14:24:49.286087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.291857Z","title":"Classification Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.291857Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:86f4d0160b59370cb223bfabcee722df3adea4bf60ac84e3b57c1964ac52a909","observation_id":"aafe544d-f17a-4557-a3b7-65bcaa860b07","resolution":{"observed_at":"2026-08-15T14:24:49.291857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.297126Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.297126Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d478a9bb6591d7948e0bddaa22deccb0e5afa0a2f612125ef291383d0d0cde29","observation_id":"03f39d12-37c9-475e-8996-782a28b02c46","resolution":{"observed_at":"2026-08-15T14:24:49.297126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.302190Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.302190Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f3848d69a50ebb56c5f09e03b9f5f2b47088ae244baf7a773303b5ef160ee4b0","observation_id":"9b684ccd-2da1-4a2e-bd08-f0b86098ad39","resolution":{"observed_at":"2026-08-15T14:24:49.302190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.307325Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.307325Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6452c7a34b79a5fe80edb5b9eb217c64e2700f5ce02a3df006d874323d41cad3","observation_id":"6e7c5bc3-0353-4ce4-a8bb-05eedb4e6db7","resolution":{"observed_at":"2026-08-15T14:24:49.307325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.312726Z","title":"and Rennels, Glenn R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.312726Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:3917572132319fc9fcf5229da0b896ff031a06bdaae2d32d25149f246682673e","observation_id":"b370780d-21ed-4d8e-922a-391605fab0d1","resolution":{"observed_at":"2026-08-15T14:24:49.312726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.318979Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.318979Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e86a8d632a49a90694ffe144198310f515a05d772f496f1a145cc18e15ba4145","observation_id":"7c2213ad-8c12-4d7b-a616-e70bc73431ad","resolution":{"observed_at":"2026-08-15T14:24:49.318979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.324337Z","title":"Transfer of Rule-Based Expertise through a Tutorial Dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.324337Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:70fb66954a38ff819463596772a4c315d9e1f47cfecc0fb6c685561f973d1d3f","observation_id":"1af58472-120b-4390-a2f6-3e45ba91d558","resolution":{"observed_at":"2026-08-15T14:24:49.324337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.330017Z","title":"The Engineering of Qualitative Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.330017Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:133039f636cbbca2fd0f7917d072759b59d6fe2a78eed203c8ceb273e9f51c37","observation_id":"30e37e8f-9630-4387-a5dc-7562ba936e85","resolution":{"observed_at":"2026-08-15T14:24:49.330017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.334945Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.334945Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:2f4d4e2056e87ce749b0f4315803be7d53731922a1710edc7f80e680362bd825","observation_id":"8dd50b5f-f6b2-47c0-b120-2f58e7e202f2","resolution":{"observed_at":"2026-08-15T14:24:49.334945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.340125Z","title":"Pluto: The 'Other' Red Planet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.340125Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9790aa676dcd7b1c7865c04f2837ee66facabd25697c7bd4edeaa646097330a3","observation_id":"8412b579-2ad8-4563-9fc2-71154bb189a0","resolution":{"observed_at":"2026-08-15T14:24:49.340125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.155702Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"64ea129b-4610-40c8-891e-1f3e8b0bf0a8","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.366719Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:4f933a2e87ba01fd715e5863fc740e023e4ccfb459936a43cde7ef8115444c29","observation_id":"228938b6-472c-4002-bb00-eaa25e47f0d7","resolution":{"observed_at":"2026-08-15T14:24:51.161453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.139324Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"72fbc254-d0da-4bd3-ad68-789477293117","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.387989Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:acbe3c150f98b45b45b5559749450cae64b3d022716ed2a9571afa98a885b5f7","observation_id":"08e7d26c-4bf3-49e6-8c3b-0f8a7c03056b","resolution":{"observed_at":"2026-08-15T14:24:51.144189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.121911Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"d6d5c695-eefa-43d5-b380-d16f9d5b7654","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.392957Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:92493f45b831439949f13d4ea8253a74656e2bffe4434783d847a94fba7dee90","observation_id":"83099ffa-5463-4801-8505-c206be410151","resolution":{"observed_at":"2026-08-15T14:24:51.127311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.105198Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"88ae35ab-6392-4509-9059-c1bbf940d938","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.419372Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f4bc86281d5bdc7d1f422f1efe544ad0619e5a7e2bea94a956239d377a9ea371","observation_id":"3dd945eb-064e-4277-833e-943d8cc322aa","resolution":{"observed_at":"2026-08-15T14:24:51.110729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.087763Z","title":null,"venue":null,"work_id":"b8f94ad5-72fe-4329-9f92-981a3d736aa2","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.429522Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:09eae1868b4138cc42a7af978f08d79779cf92eb2501ece4fc73bf918593df1c","observation_id":"c0c9e85f-a084-4bbb-96e2-1570013db0a5","resolution":{"observed_at":"2026-08-15T14:24:51.093297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.071103Z","title":"2024 , organization=","venue":null,"work_id":"71c0847e-b3e5-4d33-875f-a4f06c36eca5","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.434452Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:fc6d5d1747847d35d8540aa3b8aaacfe1953191b4a3fb0cf2127d54fa3d5591a","observation_id":"4e7208e8-6538-4df6-b419-8ca1cf767783","resolution":{"observed_at":"2026-08-15T14:24:51.076144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.051519Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"fb5a8e21-ed97-48a1-8832-478debfbe184","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.440055Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6b07e6a9f6ce65e4a3f70451a992d50c673e28e60338ad896f3f33f61d4596de","observation_id":"3b98b798-fc97-4541-bc10-1eec8dbbd7f8","resolution":{"observed_at":"2026-08-15T14:24:51.058351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.033101Z","title":null,"venue":null,"work_id":"2588a65a-4e69-43fc-9639-2043ad6602fa","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.445335Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:21816138097ab1451ca15d2097edd18e74bf616ba51475f764deeab017da01bc","observation_id":"af1397e5-5deb-4e3a-8ee1-3a02f280d7c2","resolution":{"observed_at":"2026-08-15T14:24:51.038568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:51.014737Z","title":null,"venue":null,"work_id":"08916d13-5aae-445a-b5bf-50d2c12c2b3f","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.455750Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e5106d1bb9ee9b07b8f5d90f331e2d96b46fa9e277c8d22bd9014c5bdbde38f4","observation_id":"bd1c348e-53c4-4dfd-ac82-5f65f525fdf2","resolution":{"observed_at":"2026-08-15T14:24:51.019929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.998135Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal","venue":null,"work_id":"4c8c204a-d89e-498a-ad3e-aadd54d84a6b","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.460698Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8746f088135c0ea5a88a004386ab935ddfb310cd5a8009834629086cc9cd1ffb","observation_id":"7c801524-ce3b-49e5-af20-dae48fee7937","resolution":{"observed_at":"2026-08-15T14:24:51.003543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.981034Z","title":null,"venue":null,"work_id":"3aee47b6-ecdc-4678-9707-3df20e55a770","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.477037Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:789a46983b87c51d04144f0604208def04ac4d5ebb927e3d0f21a5d867a4d8c8","observation_id":"217032c7-0fc6-4961-983f-9dfe298829f1","resolution":{"observed_at":"2026-08-15T14:24:50.985880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.963506Z","title":null,"venue":null,"work_id":"8c897429-2bde-45a3-8a17-fd3b0d39ff19","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.481819Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f8350fa3ebb463c7d5e13c03fda891f3fd6b9d0a41e7031e2bd3b35f99161b65","observation_id":"ec4efce1-7f79-4e07-9aa5-0179b1da6d55","resolution":{"observed_at":"2026-08-15T14:24:50.968545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.946648Z","title":"Computer Vision -- ECCV 2024 , year=","venue":null,"work_id":"3937c21e-a2f8-4c88-a2ed-6460c4f94a33","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.486867Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:5f04d2433888c0d0f2535a4db073bd1655164de6c28acca29fc7b2d3a798ea66","observation_id":"a63deb8f-bea4-4fa6-b41b-7cc2d9cdeff8","resolution":{"observed_at":"2026-08-15T14:24:50.952194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.929858Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"bd556cd2-71fe-4d8c-b147-3fa425809e07","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.491449Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9077fb4c7785c0b9bd7bc9d60ef9bca64e1fbec8b308c8e383dc3a5b17220823","observation_id":"953d98a7-bbe0-4ebd-b7b5-21f38ce009f0","resolution":{"observed_at":"2026-08-15T14:24:50.935088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.913023Z","title":"2025 , eprint=","venue":null,"work_id":"41dd196d-e919-4f55-8f02-6bb6bff8915c","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.496220Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:504df4a6dc75ab24ad2dafed2fc0fa08ed1f815eb2c2d0e2fdfca869fcebe8af","observation_id":"2c142d4a-a0a0-47df-913c-31da69c8f934","resolution":{"observed_at":"2026-08-15T14:24:50.918592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.896355Z","title":null,"venue":null,"work_id":"8846f5b1-7a2a-4344-ac16-8c519ef08c18","year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.506246Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:5f0d99bc26d7d0410fd0ab994e1bc1d19f2fcad33978caec5d26beb1b2b4625b","observation_id":"034ce379-cce3-4d28-9fb0-a351d1e9e384","resolution":{"observed_at":"2026-08-15T14:24:50.901331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.516080Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.516080Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:74d336f5104ff95474ade671cb5ef1e1e8835e4240d913d43ffa90acb03beb3e","observation_id":"4d562cb7-31a3-43b9-a9dc-e10ec02ef7d5","resolution":{"observed_at":"2026-08-15T14:24:49.516080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.546118Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.546118Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ffda952c31eeeb4becbf4acc1f09159ab52276a0f8810f299fb911ae61c10dc9","observation_id":"3d8d9528-f3c7-4256-862a-3c5a8ccba9fa","resolution":{"observed_at":"2026-08-15T14:24:49.546118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.859010Z","title":"2025 , howpublished=","venue":null,"work_id":"8ce11c6c-ef27-4011-85b9-9d0a07db4a83","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.551124Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d1c39e73ae411ba7167cfb0b0dad3c95b2960d70596d683ffeb9d71dc8edc530","observation_id":"42b41b8a-ddef-45ae-a798-53896366a1fd","resolution":{"observed_at":"2026-08-15T14:24:50.863889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.843830Z","title":null,"venue":null,"work_id":"af9b9844-ebe0-4fa6-942a-79ac1765c049","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.561077Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7a01c85d59ea3556f6747e7bf10df3e08bf107eb3891a24e704b027e76aa4077","observation_id":"b99c6442-d704-4675-9462-6145ec9c58e7","resolution":{"observed_at":"2026-08-15T14:24:50.848497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.566112Z","title":"S.; Dong, Y.; Roy-Chowdhury, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.566112Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:8e23dd8080c1d81d699223b4de80250af00eb71375a7a9c10f952a7a3fb0a0eb","observation_id":"7af71618-73f6-4217-a0d6-926fb2b4d874","resolution":{"observed_at":"2026-08-15T14:24:49.566112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.828136Z","title":null,"venue":null,"work_id":"67cfe607-6d20-4227-b9d7-aa370ecd803a","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.570974Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:2688c5087254f09bfb17cda69ad55ff8668d22f003392cc6b638254b2a992049","observation_id":"fcac46c4-dee3-4c64-9f6c-298a3dc99766","resolution":{"observed_at":"2026-08-15T14:24:50.833135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T14:24:49.575768Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.575768Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1430a3beb26790818d4129d8e5a78ad9233215c118c1e91a7610c64e314510c8","observation_id":"ead0cd05-33b7-4a54-9afc-9b2b4d1ec861","resolution":{"observed_at":"2026-08-15T14:24:49.575768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.580381Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.580381Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:a88941103a06f1adf449e58708b13e15b45a3762fa5aa2ca71c4cb66f8bfd8c8","observation_id":"59813561-4a5a-4fbc-88bb-df1b70ebd447","resolution":{"observed_at":"2026-08-15T14:24:49.580381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-15T14:24:49.585173Z","title":"A.; Ma, W.-C.; and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.585173Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:dd06886042c15378274018cb8d24c1329a06f3e239c087f9a53252a8ad9b2681","observation_id":"22e5aa0d-b540-4990-9f7d-b19fcaec8339","resolution":{"observed_at":"2026-08-15T14:24:49.585173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-15T14:24:49.589605Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.589605Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:621cb1caa0e5285dea40976431d011d9a95f7ce357416ac12f3a70580ed18ece","observation_id":"5948ede7-3092-4529-985d-e8cfa1c54525","resolution":{"observed_at":"2026-08-15T14:24:49.589605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.811669Z","title":"S.; Chakraborty, S.; Singh, V.; Guan, T.; Wang, M.; Velasquez, A.; Beirami, A.; Huang, F.; Manocha, D.; and Bedi, A","venue":null,"work_id":"7e759238-8468-43c9-a37e-2f95d2d050ac","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.594546Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:a8608e29c513653fa458e775bd17f95159c1732f5d6ddf0ec339ba74106b7f4a","observation_id":"31627a61-ebd4-4a9b-ab3a-ae7869c2a350","resolution":{"observed_at":"2026-08-15T14:24:50.817152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-18T12:18:02.474208Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-15T14:24:49.599621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.599621Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:425497214471a2e51539b2874a6bb5cc34dd2e0234ceb7f8161722f4439bd26b","observation_id":"28abac41-ddee-48b4-b94f-af4761b95fc6","resolution":{"observed_at":"2026-08-15T14:24:49.599621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.795990Z","title":"T.; and Zhang, Y","venue":null,"work_id":"55af4183-e2d5-4f5b-abbf-343ab65c760c","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.604537Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:4fd59e7c8382dfff7175921d5fdf468c2470ed04104fb65e81451f86c3f05d79","observation_id":"25918594-f841-43f1-8862-2212b3e99ad6","resolution":{"observed_at":"2026-08-15T14:24:50.800740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11619","last_updated":"2025-03-14T17:39:45Z","snapshot_observed_at":"2026-08-16T12:49:55.584446Z","submitted_at":"2025-03-14T17:39:45Z","title":"Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense","version":1},"cited_work":{"arxiv_id":"2503.11619","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11619","snapshot_observed_at":"2026-08-15T14:24:50.315811Z","title":"Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense","venue":"cs.CR","work_id":"262c0d08-303d-4845-8f11-749a393c7c8e","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.609578Z"},"links":{"cited_paper":"/paper/2503.11619","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:ba3441e6b1c599b54fe52a162fe4d5be04a2892a5d7d120872d7c464e56d5149","observation_id":"4dd94b19-98cd-4cea-987c-4013b0862739","resolution":{"observed_at":"2026-08-15T14:24:50.323213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.780012Z","title":null,"venue":null,"work_id":"39676efa-18d3-4be2-bf01-cebe3d1f073c","year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.614405Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9805bb7bfed2496af171cd1c62d810fc044dc72bc53f9f3dad9181081fc823cf","observation_id":"5ac197ff-34c5-4570-82fe-84b6764a67ae","resolution":{"observed_at":"2026-08-15T14:24:50.784835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.764429Z","title":null,"venue":null,"work_id":"f3937041-1029-401e-9acd-f0f26f854705","year":2015},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.619496Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1f8dd824f281424d4abf95ec2a776ff6d25ba9214ed32ac900e9433dcef22b33","observation_id":"2dc6e744-3892-41f5-815d-f8b9a5e4ff39","resolution":{"observed_at":"2026-08-15T14:24:50.769285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07571","last_updated":"2024-11-15T03:20:57Z","snapshot_observed_at":"2026-08-16T13:10:52.387651Z","submitted_at":"2024-10-10T03:12:03Z","title":"How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?","version":2},"cited_work":{"arxiv_id":"2410.07571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07571","snapshot_observed_at":"2026-08-15T14:24:50.594188Z","title":"How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?","venue":"cs.CL","work_id":"9d1e7479-4264-4dd3-b06e-0b8e23ecb7fe","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.624109Z"},"links":{"cited_paper":"/paper/2410.07571","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:4c6b625a2efdde4748e113edefb884819e700f12d0cfba87cefe0d0d31108a1e","observation_id":"b9bf0e8c-3aaa-4677-8afe-b2c4d7fd2db9","resolution":{"observed_at":"2026-08-15T14:24:50.599930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09792","last_updated":"2025-01-13T03:30:37Z","snapshot_observed_at":"2026-08-16T14:09:42.048334Z","submitted_at":"2024-03-14T18:24:55Z","title":"Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09792","snapshot_observed_at":"2026-08-15T14:24:49.628739Z","title":"X.; and Wen, J.-R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.628739Z"},"links":{"cited_paper":"/paper/2403.09792","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:6fbafb2210c496d4e5f9388991bf20d6366bd522304011d02acdec5c2f028959","observation_id":"b330890a-6d8b-4c62-a945-a091af957280","resolution":{"observed_at":"2026-08-15T14:24:49.628739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:24:49.633399Z","title":"F.; Cheng, K.-T.; Choi, Y.; Kautz, J.; and Molchanov, P","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.633399Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1aafd910aa5e9f5d1d7c1367bbf2fbe05e700f6ee30625164f4d2659105ae3e9","observation_id":"8c6746d9-388b-4d77-992a-e3c437860635","resolution":{"observed_at":"2026-08-15T14:24:49.633399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.748469Z","title":null,"venue":null,"work_id":"19c157dd-3bf4-42c0-9ce1-b9b05257b518","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.638422Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:32c06f558f6b3cfec017e85db1633707ed70c4b8897c3a068fbc877720f067c4","observation_id":"a1c14e02-0921-4471-83ab-86e644c7fb38","resolution":{"observed_at":"2026-08-15T14:24:50.753489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.731230Z","title":null,"venue":null,"work_id":"0f1e9eb8-74b1-45d0-921f-b7e3487178d5","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.643490Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:f890ac0d1b4cc1f909296d740b048ea208486abc59b202b934833322b257b898","observation_id":"269c60e0-8b68-425e-9851-c51d0534576f","resolution":{"observed_at":"2026-08-15T14:24:50.736673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01703","last_updated":"2025-01-31T16:47:16Z","snapshot_observed_at":"2026-08-16T13:03:21.772880Z","submitted_at":"2024-11-03T22:19:20Z","title":"UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01703","snapshot_observed_at":"2026-08-15T14:24:49.648328Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.648328Z"},"links":{"cited_paper":"/paper/2411.01703","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:956cdb2d8ea808fdcd466cbc28033d67d0001a8be984983448c4d81acefdaca8","observation_id":"0566dc98-f71a-4d25-95ae-b9bf57f6730c","resolution":{"observed_at":"2026-08-15T14:24:49.648328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-15T14:24:49.653520Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.653520Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:9de59a7f87ddbd1a685e3568a5ef974607a110acdd24a7d12e0afe702d3c0063","observation_id":"490d3cb1-abf5-456a-8af5-94c4a05e0634","resolution":{"observed_at":"2026-08-15T14:24:49.653520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02906","last_updated":"2024-06-17T16:53:49Z","snapshot_observed_at":"2026-08-17T22:09:41.799837Z","submitted_at":"2024-01-05T17:05:42Z","title":"MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02906","snapshot_observed_at":"2026-08-15T14:24:49.658164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.658164Z"},"links":{"cited_paper":"/paper/2401.02906","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:2417235eb066c971358a449d37dfe0ec50d246f997c99bc33b50c45057dd78b5","observation_id":"f1bdd4e5-71c7-40b5-a5a0-d9479f72aa14","resolution":{"observed_at":"2026-08-15T14:24:49.658164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-16T13:44:04.481701Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-15T14:24:49.663318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.663318Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:15cbe778367ff7b698128304af25da2ac93b5ffd72ea6d5bf41db3272bd844dd","observation_id":"b468061a-8828-426a-a25a-39e7fb2a1094","resolution":{"observed_at":"2026-08-15T14:24:49.663318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-16T15:21:48.065276Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-15T14:24:49.667991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.667991Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:1b1c64b5d8487be19ab489a38be0732df7c83b9dfd16580aa2e0bd0e8567eadf","observation_id":"ff2c9902-8178-4ac7-b812-54158f74d295","resolution":{"observed_at":"2026-08-15T14:24:49.667991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.713995Z","title":"D.; and Finn, C","venue":null,"work_id":"30904184-047a-4355-87d7-8d6cecd1d7ee","year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.672709Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e18e46815ae8fdebe96226aa49b0b7859115004fb48d59a8e50afc38face0703","observation_id":"80bcc7fb-bb9c-4d73-a9a3-fce47d6851a4","resolution":{"observed_at":"2026-08-15T14:24:50.719088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.678351Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.678351Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7d77a1814594f13ace49af80a875b441284536b8e6927497e2aea5b03191e020","observation_id":"a084824b-141e-4c09-b436-0b33272b7c61","resolution":{"observed_at":"2026-08-15T14:24:49.678351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.697543Z","title":null,"venue":null,"work_id":"5577f9bb-2708-43d9-bcee-e42b0c9b1a54","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.683390Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:4fe037745cb913bc9dbd827aeb4f8d3330f7974f15732af5735e373479c4b7d5","observation_id":"ee26d16d-fc61-46ae-9fbc-4cce92410aa5","resolution":{"observed_at":"2026-08-15T14:24:50.702794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T14:24:49.688116Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.688116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:72cd0420f1d8e9f7fb05d54de05fa4f17631269fb115db1e65de2994593b3f03","observation_id":"f619761b-f2a6-471e-88ec-11824f613c4f","resolution":{"observed_at":"2026-08-15T14:24:49.688116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.680829Z","title":null,"venue":null,"work_id":"b4cd46a7-ba18-4bc2-8c45-b7c5fb2f4906","year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.692606Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d6a3b4ef2786546edf04762b852aa936e15e36f748c381503666fcf0076fe109","observation_id":"fc5301ea-d58a-41b1-b04c-c916f780f957","resolution":{"observed_at":"2026-08-15T14:24:50.685891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-08-16T14:28:07.420590Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-15T14:24:49.697447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.697447Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:324493d2990d236b6f6d0712a68797e08c9c0891c2f055645a171819d1953a73","observation_id":"35a00d1f-c63b-41cb-a266-798754d1fa60","resolution":{"observed_at":"2026-08-15T14:24:49.697447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.664187Z","title":null,"venue":null,"work_id":"031e0724-5b8d-47ae-a194-266cfefc8b80","year":2015},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.702249Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:06f22afe02e2f6baf7dd3430f65e00da1b49e5f71c96200c054550834dedfa0f","observation_id":"319c5e91-143d-4896-964a-00b3ea1e1ccb","resolution":{"observed_at":"2026-08-15T14:24:50.669292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11206","last_updated":"2024-01-20T10:41:03Z","snapshot_observed_at":"2026-08-16T14:25:56.925750Z","submitted_at":"2024-01-20T10:41:03Z","title":"InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11206","snapshot_observed_at":"2026-08-15T14:24:49.707221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.707221Z"},"links":{"cited_paper":"/paper/2401.11206","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d6eff25cb73d4efdb9c30473b1cb77946a22d85fcbe2bbdce47cc7be224ffdd0","observation_id":"60a371c4-1909-450e-ae9c-02d9c15c21ed","resolution":{"observed_at":"2026-08-15T14:24:49.707221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:50.647714Z","title":null,"venue":null,"work_id":"d4fc473f-69b5-4674-828a-bc631e09ce80","year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.712315Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:7413953bc85b97f73313ca21a4d645ea2fd0023d46f32660926ac927ac9cc229","observation_id":"b252a0b5-1046-4f9f-8096-c4836462f329","resolution":{"observed_at":"2026-08-15T14:24:50.652790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.717212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.717212Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:923d5a5b677d6c909625227345192131bc6148ded2904e9776422c0a2799c4cc","observation_id":"47cbe7ae-0820-4309-b7a4-a69d2c725db3","resolution":{"observed_at":"2026-08-15T14:24:49.717212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-12T22:07:51.112849Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14881","snapshot_observed_at":"2026-08-15T14:24:49.722202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.722202Z"},"links":{"cited_paper":"/paper/2502.14881","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:111b61b164f6fe903104f5457c61286d22aa4602975c68454c0a3520b88a29c8","observation_id":"2c287b8c-e440-414c-8279-c9fa5299dea6","resolution":{"observed_at":"2026-08-15T14:24:49.722202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T14:24:49.727045Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.727045Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:085244683a57e39ef31ffd1d269e22fb7cb346d960d08dae0ffdc3c886f62f65","observation_id":"d9b1a76d-8748-4a6d-ad38-cde6c6a62f53","resolution":{"observed_at":"2026-08-15T14:24:49.727045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-17T05:28:50.285614Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-15T14:24:49.731853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.731853Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:aa7b7e0a1d6b91b8d13168fd42e572795c3c7cb920b9477b4a284c19c05a1322","observation_id":"0124c92d-8536-4a13-87e3-6d0eaf31fbb5","resolution":{"observed_at":"2026-08-15T14:24:49.731853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:24:49.736633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.736633Z"},"links":{"citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e3de9b70a280d75a546b4d2a520e7acfff7a61622554e587ffd23a4461469072","observation_id":"bff65539-c313-49db-a9ae-bb5b9155bc60","resolution":{"observed_at":"2026-08-15T14:24:49.736633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-17T15:53:34.369922Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-15T14:24:49.741420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.741420Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:e6503376d4ed9ac57b7d887fa208a943fde48ce5c47506501b4ede1a9ad04c0a","observation_id":"c10d224c-4731-4766-8304-f2d4adcf8da4","resolution":{"observed_at":"2026-08-15T14:24:49.741420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-08-16T13:11:26.444085Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-15T14:24:49.746172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.746172Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:c6cead562dc6e96637db905d2fd57ae93380ef1fbed21c0c93fef588dc62e712","observation_id":"96f4e123-ea8d-4458-b644-8b37f42e79f0","resolution":{"observed_at":"2026-08-15T14:24:49.746172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-16T14:21:50.770067Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-15T14:24:49.751283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.751283Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:d760cf4f4e386c8b4fba09a43541ed129d39fd757e1c36bd8aa3827fa2176deb","observation_id":"c33304f9-7846-4db1-818e-036cdd66476b","resolution":{"observed_at":"2026-08-15T14:24:49.751283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13095","last_updated":"2025-02-18T18:06:48Z","snapshot_observed_at":"2026-08-17T22:11:45.759074Z","submitted_at":"2025-02-18T18:06:48Z","title":"Understanding and Rectifying Safety Perception Distortion in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13095","snapshot_observed_at":"2026-08-15T14:24:49.755989Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.755989Z"},"links":{"cited_paper":"/paper/2502.13095","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:2f316c53d869d8407ad9986d92643b99182adb7ddf757e284f02a14f7f4f1a9a","observation_id":"0d7bae29-0166-43e4-84d7-a3053f47ca88","resolution":{"observed_at":"2026-08-15T14:24:49.755989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02534","last_updated":"2024-08-26T22:56:28Z","snapshot_observed_at":"2026-08-16T13:38:02.474752Z","submitted_at":"2024-07-01T16:58:55Z","title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02534","snapshot_observed_at":"2026-08-15T14:24:49.761179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.761179Z"},"links":{"cited_paper":"/paper/2407.02534","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:88057d77c4b1aa6fac780922a70d81046f8b3843d68960edd36fb3685221c75a","observation_id":"fcbbe27f-914f-4b57-9fd5-cf34162e1e2e","resolution":{"observed_at":"2026-08-15T14:24:49.761179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T11:46:05.179201Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.10513."}