{"as_of":"2026-08-10T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e396e359847acedad1d1aad6c4e88f0c299c09dca77078a400db8737cfc6c220","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:20:22.468041Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01373/citation-record","integrity":"/paper/2608.01373/integrity","json":"/paper/2608.01373/citation-record.json","paper":"/paper/2608.01373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.208509Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.208509Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:734e7e61e7bd95b940c0b493387463726f60f7d71561c814975a3806e53f771f","observation_id":"3629e27b-7410-4117-a788-f0342e2261d7","resolution":{"observed_at":"2026-08-06T00:20:22.208509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10490","last_updated":"2023-10-03T17:03:10Z","snapshot_observed_at":"2026-08-08T22:08:37.768137Z","submitted_at":"2023-07-19T23:03:20Z","title":"Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10490","snapshot_observed_at":"2026-08-06T00:20:22.213214Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.213214Z"},"links":{"cited_paper":"/paper/2307.10490","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:8ca5c02291eb4a91a972bd696f14854595d49ea9e5c481c7a76db8a28a6328e2","observation_id":"293a4c02-1cd1-473b-8c3d-18967550e9d9","resolution":{"observed_at":"2026-08-06T00:20:22.213214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.217428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.217428Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:31f2030a1f7e1afe4d4c242c90ba63ec638ce03ffde951a6855b8a427ed2adcd","observation_id":"19d30d57-97eb-4213-8a8e-dd7390c0d1ce","resolution":{"observed_at":"2026-08-06T00:20:22.217428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06705","last_updated":"2019-02-20T17:38:32Z","snapshot_observed_at":"2026-08-02T02:05:14.321072Z","submitted_at":"2019-02-18T18:18:27Z","title":"On Evaluating Adversarial Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06705","snapshot_observed_at":"2026-08-06T00:20:22.222098Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.222098Z"},"links":{"cited_paper":"/paper/1902.06705","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:97f1713f8bd7ec8993ac315516ac99f8b9e2c3d1074a326a3222ab5d1c63a8e5","observation_id":"20731d07-f05d-41c5-8049-214322b452be","resolution":{"observed_at":"2026-08-06T00:20:22.222098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.647056Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":"4326ef6e-8a09-4f5d-8628-311b97ffb161","year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.225914Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:5217cb2a47c834b573c3f23a93767d48da6eaac1f6b51338868b0196ffb0c7c0","observation_id":"65ba52db-99ea-49f5-9a26-08cf1fa175f0","resolution":{"observed_at":"2026-08-06T00:20:23.650888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.635164Z","title":null,"venue":null,"work_id":"2eb93ff3-03f3-499e-94cf-72cfc874d3de","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.229439Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c8446929bfbe8ac40e7a1946804cc73aab7104fdd342596e005e58fbdf434ad2","observation_id":"9d268cf6-097e-4be5-8792-55265e7496e5","resolution":{"observed_at":"2026-08-06T00:20:23.639106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14159","snapshot_observed_at":"2026-08-06T00:20:22.233147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.233147Z"},"links":{"cited_paper":"/paper/2511.14159","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:54140bb2353dc00c092cc59cc7892a81662988271c3d174733e8247570ef10b4","observation_id":"2349667f-29de-4e3e-8a97-378435d08351","resolution":{"observed_at":"2026-08-06T00:20:22.233147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.624083Z","title":null,"venue":null,"work_id":"f8b41ad0-27f9-4b6c-9300-0c7870af2983","year":2022},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.236611Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:b83d3eb32f26848160e16bf9febb9c8f29e046e914ecea03607e6cd45860a54c","observation_id":"dafb9fc7-9281-4118-bae0-38fd2973383a","resolution":{"observed_at":"2026-08-06T00:20:23.627678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10414","last_updated":"2024-11-15T18:34:07Z","snapshot_observed_at":"2026-08-06T19:21:24.933454Z","submitted_at":"2024-11-15T18:34:07Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10414","snapshot_observed_at":"2026-08-06T00:20:22.240423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.240423Z"},"links":{"cited_paper":"/paper/2411.10414","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:9a13720f78a394a7650d587c6b3c73b73c93581172c3350acef2ad1a9a371b25","observation_id":"27324d3e-51bd-489e-8c99-24bf9002c4bf","resolution":{"observed_at":"2026-08-06T00:20:22.240423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.613473Z","title":null,"venue":null,"work_id":"393fcfea-8493-402d-9005-9985ccfdb519","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.245421Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c5d6e3c46aa584d4cd710ed0c79d06271818e1f2c4a860daf030f372754c167a","observation_id":"f2b19fb0-28bc-41c9-96b4-5a6df5bbf9a5","resolution":{"observed_at":"2026-08-06T00:20:23.616878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.37557","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.097909Z","title":null,"venue":null,"work_id":"697e8664-c588-4dd0-9ac0-7e671c5e60e5","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.248930Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:dff74d38d10b03795cb56e48b7584da8e0e6b135c9831bdcc0f7f3bb3d8910e7","observation_id":"aa0637ab-e2eb-49f2-bf88-d3e686b00ece","resolution":{"observed_at":"2026-08-06T00:20:23.105207Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.601941Z","title":null,"venue":null,"work_id":"786985c6-355c-4d54-88c1-5c4c3beead75","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.252154Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:937e59e056293f483b18ade9b9bd92b0e7571e05fb2e58a1baf2066792e63dc5","observation_id":"2e619a46-978c-4d59-9b1d-11627e5c27c7","resolution":{"observed_at":"2026-08-06T00:20:23.606201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.255497Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.255497Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:719e395bc25072b618ad541ecc9aa349376f1c1e9eab49afc85a8f30d622f0c5","observation_id":"edc76c58-25e7-4372-af92-b6d0ffa6960f","resolution":{"observed_at":"2026-08-06T00:20:22.255497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.584550Z","title":null,"venue":null,"work_id":"a2f28cc4-07e3-40ef-9a20-8b571643f879","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.259561Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:8a2df77699be97c7cd94e0e244d49a7203544a39071ebe42eeb71389c27fda58","observation_id":"fe28d7eb-ba5a-4898-a8e6-23ea15849ddf","resolution":{"observed_at":"2026-08-06T00:20:23.589203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T00:20:22.262884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.262884Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:70e8f2aea670796facbc421280af1ac6ab36236c74746581ef79ee068fe9c1f6","observation_id":"4119471f-1454-40f2-a60b-7e69d8a05a92","resolution":{"observed_at":"2026-08-06T00:20:22.262884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00872","last_updated":"2021-06-02T00:48:33Z","snapshot_observed_at":"2026-08-09T22:30:48.348671Z","submitted_at":"2021-06-02T00:48:33Z","title":"On the Efficacy of Adversarial Data Collection for Question Answering: Results from a Large-Scale Randomized Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00872","snapshot_observed_at":"2026-08-06T00:20:22.267252Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.267252Z"},"links":{"cited_paper":"/paper/2106.00872","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:6e9a7c4da76204edfed676c7a0fcb95594c28727c0d6794656402dc649b9ebc5","observation_id":"2d06838b-2f9c-4f70-861c-be723031ea80","resolution":{"observed_at":"2026-08-06T00:20:22.267252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.271722Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.271722Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:4ac7193a204f92db79006d5c7bac8c4dd34f723804bbcfd5e053436709d63211","observation_id":"7800fa2b-6e04-4735-8d82-29b0693692e0","resolution":{"observed_at":"2026-08-06T00:20:22.271722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.571325Z","title":null,"venue":null,"work_id":"bc30e46e-d83c-4d1f-a958-17507b2ef399","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.275188Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:70d5bec543d44d4eac82dc46b418ba5bdc6a6fa317bae34f382f7579dda2d769","observation_id":"9c0ac5b2-486e-47ea-b6d8-8f49d5df4741","resolution":{"observed_at":"2026-08-06T00:20:23.575516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.279092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.279092Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:ffca04e420609b2c5bb59ec1c03a9672ab0f69f50882b2f8e99c02d638a26677","observation_id":"b61a8b09-2de5-4650-bc09-4ffaac5b1fb0","resolution":{"observed_at":"2026-08-06T00:20:22.279092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.283575Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.283575Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:9381b530cb19382d99c14d8cef5ccdc7ebad0afd8c5083367e6d597c8a0284e3","observation_id":"f02b9109-8cbf-4441-b4f2-5d0fc0f61707","resolution":{"observed_at":"2026-08-06T00:20:22.283575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.287942Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.287942Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:50aeedb39d8d6e865a621ec817e455488aafaa71852e971a3421e10c96217bc3","observation_id":"ec82f193-a6aa-4250-8bb7-2d180c2146e7","resolution":{"observed_at":"2026-08-06T00:20:22.287942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.291089Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.291089Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:d6771cdafaedf4c6d42b130c1c30b01d0b14ad573e57dc5cc0a4c32c2232f8cd","observation_id":"8760fbd3-bc4e-40e2-8d3f-3cc86fb4f6ed","resolution":{"observed_at":"2026-08-06T00:20:22.291089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10486","last_updated":"2025-02-14T08:44:43Z","snapshot_observed_at":"2026-08-09T21:15:29.298237Z","submitted_at":"2025-02-14T08:44:43Z","title":"VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10486","snapshot_observed_at":"2026-08-06T00:20:22.298804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.298804Z"},"links":{"cited_paper":"/paper/2502.10486","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:94141041a9eb2276fceb8395aea3b3d05f8cb10f631ec33a56c8da874780cfd1","observation_id":"1614d059-5638-498a-8278-cf6fbd934fa6","resolution":{"observed_at":"2026-08-06T00:20:22.298804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.302312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.302312Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:413db8ee396884affe39aa079c9db0057ca1898535e114a355c7fa1cc58b4301","observation_id":"3f8001ca-87d6-4fa8-96f7-165e392fcac5","resolution":{"observed_at":"2026-08-06T00:20:22.302312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.541644Z","title":null,"venue":null,"work_id":"8f71fd32-8044-46aa-835c-92aeb7505aa1","year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.305291Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:f53be10df83d1aeb676a1d2b14c7a021a90f31231c742c17de4bffdb6a2a7914","observation_id":"b42fbd40-a4ce-45eb-8d37-0dc27fa02cd5","resolution":{"observed_at":"2026-08-06T00:20:23.545105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.529710Z","title":null,"venue":null,"work_id":"fbc25c6a-6fc1-4403-b954-0516df066c61","year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.308578Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:34452eb10425b311029121c297d5bfaa9e61790ea5f447ac81370f09296ff40a","observation_id":"8741ea4c-386f-4717-bb26-ba1589397243","resolution":{"observed_at":"2026-08-06T00:20:23.533578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.311719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.311719Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:25b8a9a6c20b3907bba6b949b7afa4086520bb01942049ef12dce3f4d0fc7911","observation_id":"1a24d622-95ef-403a-993e-a131ef0ca629","resolution":{"observed_at":"2026-08-06T00:20:22.311719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.314629Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.314629Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:569c44b6d1bddb5e87581aa1393591e4f051be28e2354f451a6c45da284e4cd9","observation_id":"1780050e-1813-4672-9553-8d4fe8b2b2db","resolution":{"observed_at":"2026-08-06T00:20:22.314629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09050","last_updated":"2024-09-05T21:17:13Z","snapshot_observed_at":"2026-08-09T11:47:55.482303Z","submitted_at":"2024-07-12T07:18:05Z","title":"Refusing Safe Prompts for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09050","snapshot_observed_at":"2026-08-06T00:20:22.318597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.318597Z"},"links":{"cited_paper":"/paper/2407.09050","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:00d8aa8c7e83a6846a2da96565bfc86994ab131a04f9a596975a3d0df9d6556a","observation_id":"7822d158-b88b-4c1d-8e58-6a6561094e08","resolution":{"observed_at":"2026-08-06T00:20:22.318597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.511271Z","title":null,"venue":null,"work_id":"9672cd25-ec40-4371-b081-fb0233ccb472","year":2021},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.322005Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:5a2dc8bbba2eefe7978fb7d16345f6113b70543336d95436eb740102390db73e","observation_id":"ba9c76ed-5b6a-449e-a75b-96edd893f93d","resolution":{"observed_at":"2026-08-06T00:20:23.515217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.325954Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.325954Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:ce5f0ab68ef6df1b1925e116c1c67acd1901bab82c365e9d81a9faffbb06b005","observation_id":"799f4308-acdd-42a5-806b-32bc32e5d259","resolution":{"observed_at":"2026-08-06T00:20:22.325954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.492499Z","title":null,"venue":null,"work_id":"a267f491-3cbd-4f73-a589-77815d7c10f2","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.329212Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c3f10e5566496d06d0708175c3a79abb0e9b6950d3bcb90e9d747e1a40a789c6","observation_id":"58c1b2bf-2f9f-4780-bd39-e3a18448dc6a","resolution":{"observed_at":"2026-08-06T00:20:23.496141Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08676","last_updated":"2024-06-24T08:50:22Z","snapshot_observed_at":"2026-07-06T17:59:29.408432Z","submitted_at":"2024-04-06T15:01:47Z","title":"ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08676","snapshot_observed_at":"2026-08-06T00:20:22.332257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.332257Z"},"links":{"cited_paper":"/paper/2404.08676","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:4e86e8ea7eeb2b3a18b63c09bc2dba73357df667587704c0752f6b63f0b8a4b6","observation_id":"a578fb14-5c7e-45a0-b063-8f9b1e04ba24","resolution":{"observed_at":"2026-08-06T00:20:22.332257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.480161Z","title":null,"venue":null,"work_id":"347de6c7-fc4c-47be-8fb3-20ce4b02ca16","year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.336204Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:7226c03ebca83c5335330c0837d899318f59f36806e2be0f70b843394ea31fe3","observation_id":"6f3881ea-9d8f-4aa3-bc8c-850d1522180d","resolution":{"observed_at":"2026-08-06T00:20:23.484526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.467712Z","title":null,"venue":null,"work_id":"b525c536-e1c4-4dd6-a595-4ca077d58d84","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.339768Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:bc5a63ea841f43826f7c18d921a0c350c8ff61bff6e48744a0da0b2a7a3d2f93","observation_id":"1aef1d6a-b399-4f8e-8ca3-73b5428735ae","resolution":{"observed_at":"2026-08-06T00:20:23.471139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-06T00:20:22.342928Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.342928Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:786038435aa0bab3ba0fe30917f455291a68541a2cd878acfb107b20ac3cd845","observation_id":"ff18ca00-4f44-4e97-b466-aa05c69b0d1d","resolution":{"observed_at":"2026-08-06T00:20:22.342928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.457443Z","title":null,"venue":null,"work_id":"3e791a27-7594-4aeb-9ec5-3e9699488264","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.346411Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:51178926d7b9893496d36d969b2d1ffeb3a5ee9aeb9a89a039ad054c0bcfa429","observation_id":"4af54e52-f4d5-42ef-b8d8-e15434ffb409","resolution":{"observed_at":"2026-08-06T00:20:23.460866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.349544Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.349544Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:0b6606859e82e2c6143a1252a8e572012dda200d5e6449fa4cd4d83bc6004b62","observation_id":"1f363f9d-f29e-48d6-859e-cdce5c97ffa0","resolution":{"observed_at":"2026-08-06T00:20:22.349544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05930","last_updated":"2026-04-07T14:31:32Z","snapshot_observed_at":"2026-07-30T07:49:14.095968Z","submitted_at":"2026-04-07T14:31:32Z","title":"\"I See What You Did There\": Can Large Vision-Language Models Understand Multimodal Puns?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05930","snapshot_observed_at":"2026-08-06T00:20:22.352986Z","title":"I See What You Did There","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.352986Z"},"links":{"cited_paper":"/paper/2604.05930","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:76f2cef3983556f54bb650ac911e2aaf9f083631733d36cab25d464157d79423","observation_id":"a30d7ce3-ca1f-48d7-b8a8-fc755aefc2a9","resolution":{"observed_at":"2026-08-06T00:20:22.352986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.438673Z","title":null,"venue":null,"work_id":"3c39933a-cb89-4f08-80df-012ee115ea9c","year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.356459Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:2049d7cc6ca72e123933ba92b31bc17b793bcea2d115eccc896f4169af5499a9","observation_id":"261510be-0e30-48ff-ac70-99efa09e7438","resolution":{"observed_at":"2026-08-06T00:20:23.442203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.425668Z","title":null,"venue":null,"work_id":"12d1422c-6346-49aa-ab03-429e57d22164","year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.359988Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:a16f40c1977b4a414a986411eda2b3aee2ca54964c95cbe101ffa729947cb851","observation_id":"36128199-eab8-4d82-94f2-98beb01da3ad","resolution":{"observed_at":"2026-08-06T00:20:23.430820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.414613Z","title":null,"venue":null,"work_id":"3d5eeecf-ae7d-418b-af10-ba87ee5e1a8c","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.363526Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:b94885b750bfb8562982af45c2deea3d88d93064eada60fe7bf94047014f8f95","observation_id":"7da049e2-d57d-4f9a-818b-08ca78ef07da","resolution":{"observed_at":"2026-08-06T00:20:23.418421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12359","last_updated":"2026-04-14T06:48:33Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:33Z","title":"Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors","version":1},"cited_work":{"arxiv_id":"2604.12359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12359","snapshot_observed_at":"2026-08-06T00:20:22.567316Z","title":"Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors","venue":"cs.CR","work_id":"8a4542b9-408e-407c-a6e4-8ca9cb966dd5","year":2026},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.366642Z"},"links":{"cited_paper":"/paper/2604.12359","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c343239cf4601b6c4fd7e19a6fdcc86280eaa7d290eec38703341daee377231d","observation_id":"abf8fbce-344f-4e75-b73b-1bfb05cf20a1","resolution":{"observed_at":"2026-08-06T00:20:22.571078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.370171Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.370171Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:155dff052dbb451f58f6aff4b776978e70b8011574e71a2302bd529286f32b54","observation_id":"750311c0-82a3-445d-99be-3b4c1f8c7ad9","resolution":{"observed_at":"2026-08-06T00:20:22.370171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.403872Z","title":null,"venue":null,"work_id":"89839857-fb75-482d-8053-73c24ded54e3","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.373666Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:5e2f3a713fe32c1fffd6e34db0bf563f0647ee8b4c59f63cb21c5dcaa41bccf0","observation_id":"6b10d4a3-fc03-4c20-98aa-86817400bdc3","resolution":{"observed_at":"2026-08-06T00:20:23.407913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17864","last_updated":"2024-06-25T18:13:05Z","snapshot_observed_at":"2026-07-06T18:37:00.469355Z","submitted_at":"2024-06-25T18:13:05Z","title":"AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17864","snapshot_observed_at":"2026-08-06T00:20:22.377020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.377020Z"},"links":{"cited_paper":"/paper/2406.17864","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:521c33e39002ef8de007e02fb9d3917041b34cef3d4b071626812eb2448713cc","observation_id":"5b0a9b86-daee-4e2e-8222-7f02d7b7951c","resolution":{"observed_at":"2026-08-06T00:20:22.377020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.391883Z","title":null,"venue":null,"work_id":"13de2c60-8329-464b-a960-56a98384deee","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.380793Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:6005a7cf77c8b865598b85b8b194f95facf7906c05afd9d6f4a95a123e9a6d76","observation_id":"c10b5a7b-71bf-407d-b579-2ce67816bc10","resolution":{"observed_at":"2026-08-06T00:20:23.396313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.384085Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.384085Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:8c420dafad460bf218e3b38c269f799903f555a3cf30b994de5fb87cfb91a847","observation_id":"29f86938-8561-4a13-b4f7-26c35929d71c","resolution":{"observed_at":"2026-08-06T00:20:22.384085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02916","last_updated":"2025-04-09T15:20:33Z","snapshot_observed_at":"2026-08-06T17:39:01.331837Z","submitted_at":"2024-10-03T19:07:53Z","title":"LLM Safeguard is a Double-Edged Sword: Exploiting False Positives for Denial-of-Service Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02916","snapshot_observed_at":"2026-08-06T00:20:22.387882Z","title":"Morley Mao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.387882Z"},"links":{"cited_paper":"/paper/2410.02916","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:ad842307c05c7c14b5d01299cb3ec97bb48702c0a61d02c970fc844d0c03c1b2","observation_id":"93dfcea6-fce9-4c60-a72f-fdb0c5b819ec","resolution":{"observed_at":"2026-08-06T00:20:22.387882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18805","last_updated":"2025-08-26T08:40:22Z","snapshot_observed_at":"2026-08-08T01:12:52.353250Z","submitted_at":"2025-08-26T08:40:22Z","title":"Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18805","snapshot_observed_at":"2026-08-06T00:20:22.392337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.392337Z"},"links":{"cited_paper":"/paper/2508.18805","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:935dec46bdbed9a08c2789dea631325543793792973776621f74c65696ab36a2","observation_id":"d68626e0-fae3-4cee-90fd-af65acdd7ef6","resolution":{"observed_at":"2026-08-06T00:20:22.392337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-06T00:20:22.395848Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.395848Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:15429f043f6a199330ada0c251af2d818325d66a4b272dfbf40617e25e175486","observation_id":"2bc85b1a-3960-4f20-bac0-ddfd98d4493f","resolution":{"observed_at":"2026-08-06T00:20:22.395848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.373265Z","title":null,"venue":null,"work_id":"9b055635-c23f-4db3-ab57-a410eeb94da9","year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.399128Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c1fc05bc2618150eea2c7a4ab14cba7816fe9f8b3c7e1dfcc26ec1d3b544d46d","observation_id":"8600155c-99c9-4577-8d15-a739beab43f4","resolution":{"observed_at":"2026-08-06T00:20:23.377311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.402818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.402818Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:423bb6781dc2cb39c6659ca702aad460c96ee702a3490811bdf6bf233341afe5","observation_id":"fc32c107-a355-48c9-945c-fdf0ba806a2c","resolution":{"observed_at":"2026-08-06T00:20:22.402818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09508","last_updated":"2025-02-22T09:36:35Z","snapshot_observed_at":"2026-07-06T19:32:19.565785Z","submitted_at":"2024-10-12T12:10:14Z","title":"CollabEdit: Towards Non-destructive Collaborative Knowledge Editing","version":4},"cited_work":{"arxiv_id":"2410.09508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09508","snapshot_observed_at":"2026-08-06T00:20:22.509878Z","title":"CollabEdit: Towards Non-destructive Collaborative Knowledge Editing","venue":"cs.CL","work_id":"0b87a213-e08b-4b13-9d0c-901bb133cbbc","year":2024},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.406245Z"},"links":{"cited_paper":"/paper/2410.09508","citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:580176fe72e142b05b443b4dbe5a74757a71847d316c7be88e40a5adba7dcc63","observation_id":"52e279bf-dc64-4ebc-93b3-709a683137da","resolution":{"observed_at":"2026-08-06T00:20:22.516822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.356500Z","title":null,"venue":null,"work_id":"633656a2-8289-46a9-8524-41a426fc5d39","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.410120Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c04b73c43ae5a5f03d1b401136332150af88abede8adee44344e9110374bd27f","observation_id":"62ecbeb2-692a-4903-97fc-38e54eb952d6","resolution":{"observed_at":"2026-08-06T00:20:23.359858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.413436Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.413436Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:a096c40e57b0d9cc127374bfec7283aaddf50c55551b82c4715d1d395b094740","observation_id":"9bc6775c-2ebd-4ae6-b22d-053be37a69f1","resolution":{"observed_at":"2026-08-06T00:20:22.413436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.339673Z","title":null,"venue":null,"work_id":"b47d9957-d764-4d56-b45d-159ba58689e3","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.416634Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:e45ace46b8400deb375067b928888b4c98429a22269b5683e507298a758b9277","observation_id":"11411603-f865-4747-ad19-d8b76f12c340","resolution":{"observed_at":"2026-08-06T00:20:23.342786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.329600Z","title":null,"venue":null,"work_id":"41ea1c3a-977d-4b31-b504-ba7e890ac880","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.420154Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:c7299b6d17fd8e52a386a9f49e08f4daf52ff1384fcee14ed22e4344d4eafe71","observation_id":"f363cc9c-51f0-499c-bebf-e3a7a083062b","resolution":{"observed_at":"2026-08-06T00:20:23.333295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.316565Z","title":null,"venue":null,"work_id":"4a647af7-3b7c-4a5f-8086-9043ae1496d5","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.424320Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:ee5996e664bfe92d6b1fb527fcd483ac47ef23a10b6e173fbe69272b6ae86b8d","observation_id":"a2ce028c-2d0a-4064-9c56-f361e8fdecce","resolution":{"observed_at":"2026-08-06T00:20:23.320952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.305365Z","title":null,"venue":null,"work_id":"98bb018d-5645-499f-a8d3-d08a1585d1f9","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.427755Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:e3a85cdd92c378bec393600c59a6199719ccc71a21dc09fbef4240b4e763c53a","observation_id":"6e029c92-676c-4b85-ab24-26f683f3759e","resolution":{"observed_at":"2026-08-06T00:20:23.309685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.293555Z","title":null,"venue":null,"work_id":"dc10efb5-6e0f-438c-8643-974841df63f7","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.430840Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:58eb56e6937ab479ab0d30f1a1362f3923d10028f615d22bc466adc26f5cfd0b","observation_id":"574d97e9-d687-4042-ad06-ec0401bbd868","resolution":{"observed_at":"2026-08-06T00:20:23.298534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.281557Z","title":null,"venue":null,"work_id":"c6c8944a-eb73-4645-b5c9-8cc1048ccfaf","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.433718Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:aa773fbbcb9afe437d0a088e55a86f40d8e75b8993d1ec68c3a8ac14c2eb036b","observation_id":"4e9b26bb-741d-4322-bffc-3a47e72b1c53","resolution":{"observed_at":"2026-08-06T00:20:23.285618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.270252Z","title":null,"venue":null,"work_id":"76066444-0754-4748-aa38-f20a406038af","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.437650Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:bec32d4db2090ab3f0c8bba4919671f82a222e2d0a598e38d1001876c376f427","observation_id":"f9f8ed3a-a676-4d4e-824f-8ab7f59162c6","resolution":{"observed_at":"2026-08-06T00:20:23.274609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.257506Z","title":"C.2 Realistic User Simulation Prompts for ASR r Realistic prompts simulate authentic user requests tailored to each specific image","venue":null,"work_id":"6d59359c-4b5b-49b7-8e7a-d6a31e524a6c","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.441254Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:80e006576c832a6b4f1377b2b93b29078fbc75bc6d0f46282fba486efd2642e2","observation_id":"a2d1ead0-027d-4083-a12d-9a8d9b5519e0","resolution":{"observed_at":"2026-08-06T00:20:23.261894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.246315Z","title":null,"venue":null,"work_id":"820c2a0a-68f1-4f63-a995-f4257473f2ba","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.444235Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:0a3071f20b2bee5a475211d561911289b09fff1a4fcd92f72a3601934d491471","observation_id":"c560f9d8-1eb9-4197-8cdc-c10ad962623b","resolution":{"observed_at":"2026-08-06T00:20:23.250046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.234431Z","title":"remove the background,","venue":null,"work_id":"908a109a-1716-45fe-8109-2c7f83397a54","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.447313Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:a49d9666ebd11f5fcaf1f438d34f82b85554ec7d1b56b3370e329651eb2ee0d4","observation_id":"2f1a88e6-7a6c-45ad-b8f7-231aebcce5d5","resolution":{"observed_at":"2026-08-06T00:20:23.238511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.220526Z","title":"write a story about this,","venue":null,"work_id":"6970a1c6-9766-4106-91b8-cda38d3153ed","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.451156Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:89711aea27b9312d868f40b0f42f5d7e10e2cbe284470156b84a6ac1522bb02a","observation_id":"159e6f6e-5c4e-4367-8110-ff38c6506e58","resolution":{"observed_at":"2026-08-06T00:20:23.225904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.206903Z","title":"Requirements:","venue":null,"work_id":"cee2b76f-1281-488f-a491-354a0b497e3a","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.454888Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:3107fd787e876f94de0911604e1aaeab26747c6b6016437fbe14eec560b0e57f","observation_id":"fd08f194-13f4-49e1-b0a9-3dc95a565409","resolution":{"observed_at":"2026-08-06T00:20:23.210792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.195436Z","title":null,"venue":null,"work_id":"00b0291f-c211-4da0-b662-015267161024","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.457889Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:80338de70363f0c5930ab147a0ba9a75506026b28e29f807394c6016a3830a8a","observation_id":"8841b289-ffc1-4213-a51b-f67bdefbf48b","resolution":{"observed_at":"2026-08-06T00:20:23.199732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.183921Z","title":null,"venue":null,"work_id":"2f990ef6-1c76-4e4e-b32e-de20dce99e5e","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.461350Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:66bd164d8cb06e10e39b9e129caa62439291354a063426096137a43fe4c7dd53","observation_id":"d2cff1bf-d7b1-4947-a6ac-388156a4ca26","resolution":{"observed_at":"2026-08-06T00:20:23.187414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.172325Z","title":null,"venue":null,"work_id":"0c073bf7-cb49-4762-8f60-85fcfc94dcd5","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.465024Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:45d113d3cbfba72e40416ef6205a6205583b12f18fdfc7fdfca08ad6b357c792","observation_id":"b9bf7605-e520-43c6-94f7-412aca7657e0","resolution":{"observed_at":"2026-08-06T00:20:23.175817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:23.160465Z","title":"Output format: Request 1: [Your first user prompt here] Request 2: [Your second user prompt here] Request 3: [Your third user prompt here]","venue":null,"work_id":"e82a3bb3-bf1b-42fb-88c9-c6d2bd8ba234","year":null},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.468041Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:10bed188bd7907db366f49af011adbfba6f34bbf42f08a1ed908fc730d56ccc6","observation_id":"2f5279ce-6a61-44ff-a213-f1dee17996ed","resolution":{"observed_at":"2026-08-06T00:20:23.164452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:20:22.295055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:22.295055Z"},"links":{"citing_paper":"/paper/2608.01373"},"observation_digest":"sha256:eb8d1a92c1d02d9f47620f0c2d431466623b8f570594d3d8381194e36331caa2","observation_id":"c08cae40-6e14-474c-8c67-1d30353fa4b6","resolution":{"observed_at":"2026-08-06T00:20:22.295055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01373","last_updated":"2026-08-02T16:49:25Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T07:08:27.911115Z","submitted_at":"2026-08-02T16:49:25Z","title":"The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":63,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2608.01373."}