{"as_of":"2026-08-10T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:790377d1d03c6a42a12f7bb186beae4e73642cbf134eb5573ebe19e67d21b6fc","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:49:00.730675Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22398/citation-record","integrity":"/paper/2507.22398/integrity","json":"/paper/2507.22398/citation-record.json","paper":"/paper/2507.22398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:13.033042Z","title":"Generative imperceptible attack with feature learning bias reduction and multi-scale variance reg- ularization,","venue":null,"work_id":"eec244d0-9d1e-45d6-b113-303556026922","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.381010Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d042a75bcb3962145ef63462a32d6df8aff9627deea2f1f23c13a21e25b488df","observation_id":"4c0d25a3-723b-47a2-9d5c-e9793788d893","resolution":{"observed_at":"2026-08-06T11:49:13.092441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.854884Z","title":"Semantically consistent visual representation for adversarial robustness,","venue":null,"work_id":"96eef835-eefa-4685-acf1-61ba0251cd26","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.524003Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0d5e3414534fd8cb55cad192499271533dc309bd0fcb2ebcd72e71a81a299905","observation_id":"6d052d42-c2e6-41ba-9152-ed135c622b0b","resolution":{"observed_at":"2026-08-06T11:49:12.923994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.723515Z","title":"B-avibench: Toward evaluating the robustness of large vision-language model on black-box adversarial visual-instructions,","venue":null,"work_id":"25455007-9c64-4c07-bb16-8f956549f317","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.694335Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d19cb7b0c04f2c12ab58b253a231ff579fc9b7785f7fc36d4e3d4c8e49a9f07b","observation_id":"61961627-a33c-488e-b0b0-1c4c9e16ae8a","resolution":{"observed_at":"2026-08-06T11:49:12.788844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.535148Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":"e4aafb12-7c07-40de-a688-5a9fd11e6b26","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.847722Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d5a1a7bd45b0225b7774c9896adad463d144798640cacc2dd0eecd3ea582a9f5","observation_id":"3b074a1b-1473-440b-8fff-70fca5dcb847","resolution":{"observed_at":"2026-08-06T11:49:12.623017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.175815Z","title":"Towards multimodal disinformation detection by vision-language knowledge in- teraction,","venue":null,"work_id":"e2713eb7-33b8-45a7-9687-983ffcfd079c","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.034062Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:76ef7747d963b8cc792053abdefd01751b055fc0a9a7a2d4ef291cd5f2c6d395","observation_id":"9d41d25e-c688-4f82-98e2-9b244706faef","resolution":{"observed_at":"2026-08-06T11:49:12.376866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.805000Z","title":"Media forensics and deepfakes: An overview,","venue":null,"work_id":"acce2780-e875-47c8-8813-bdbb3ff5599a","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.162755Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:9b75dc07ad2a9d9bb9be42d359b630883c716f6d644427acf1ecc3d8d5e19753","observation_id":"98b469a7-2b09-452b-a7f3-04c7de08e626","resolution":{"observed_at":"2026-08-06T11:49:12.011171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.416426Z","title":"Plausible may not be faithful: Probing object hallucination in vision-language pre-training,","venue":null,"work_id":"04be960b-322c-4515-a4d5-2d7f03f1d421","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.240297Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:10cd05c9d680ed1c6d79f75268f634f362eca6b4dd9a735a661c1edfe66a17b9","observation_id":"3d295e46-7ca2-492d-9a29-b22b6feaf7b5","resolution":{"observed_at":"2026-08-06T11:49:11.584947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.044697Z","title":"Application of fourier analysis to the visibility of gratings,","venue":null,"work_id":"b78ab2e5-4326-4687-9417-4003d6096e5e","year":1968},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.374282Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:07c8adad46f7a4b9c5c049593f4e298907e91be3dde3312c890067529cc723b4","observation_id":"d731e80b-8c65-4152-a5f6-f097f03d8d24","resolution":{"observed_at":"2026-08-06T11:49:11.207771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.765969Z","title":null,"venue":null,"work_id":"104d807c-4dc0-4830-adb9-7f9563068302","year":1988},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.463719Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:70c402c04489d4511099e859a58c088d7352e2a706f0a5755996429bc30a7ba7","observation_id":"ff2873a7-e0cc-47f3-afee-f875dae0e09d","resolution":{"observed_at":"2026-08-06T11:49:10.902256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.548311Z","title":"Drop an octave: Reducing spatial redundancy in convo- lutional neural networks with octave convolution,","venue":null,"work_id":"a0eaa778-a899-4d7e-9a9d-507248b7822a","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.582544Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:542228aa1fd5aac991eaac01aa1590d5972b2cbb9cd97272e0ba789e43271136","observation_id":"03207e74-cd22-4d8c-91dc-44eaa16a821d","resolution":{"observed_at":"2026-08-06T11:49:10.625000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.288785Z","title":"Spatial frequency enhanced salient object detection,","venue":null,"work_id":"8c111ff0-db94-4837-98d2-d981f9ad0b0b","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.703911Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:cc808ddcb29e9922d7273bede97055da61667fcc14dd2a62550e511180216948","observation_id":"036f9143-69cd-4594-8fcb-e79307a2c683","resolution":{"observed_at":"2026-08-06T11:49:10.391720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.118199Z","title":"Watch your up-convolution: Cnn based generative deep neural networks are failing to reproduce spectral distributions,","venue":null,"work_id":"4d7c4466-845d-4d09-8eb9-5ed776cb7a6f","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.854386Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4595775fd38e6b33c48b7d825b21ccd7f071fc881a7328cf249fadd37165ff53","observation_id":"da3eaef7-53ad-4ba4-ba5f-55871d3637ec","resolution":{"observed_at":"2026-08-06T11:49:10.199619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.931878Z","title":"Adversarial examples are not bugs, they are features,","venue":null,"work_id":"65be6211-8efc-437f-a77a-39d9d14e14c2","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.989107Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a3404d569957bc91ebe6ed410ee64a40a80c9e734f7e58f975aa2d93fb0f230b","observation_id":"c54f1d73-6417-4877-8f05-2255039588a6","resolution":{"observed_at":"2026-08-06T11:49:10.007062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.777450Z","title":"A fourier perspective of feature extraction and adversarial robustness,","venue":null,"work_id":"48032203-8e88-4521-a87f-878a1a22dcb6","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.083160Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:b0eb3561cfe0eb19d8c40287b323483f1b8e48654e5e796305ea6262d6c5bc1e","observation_id":"01a4bb00-98c3-407e-a328-4c17cdca6b6b","resolution":{"observed_at":"2026-08-06T11:49:09.852538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.613158Z","title":"Efficient generation of targeted and transferable adversarial examples for vision-language mod- els via diffusion models,","venue":null,"work_id":"912bea59-c289-4203-a82d-c2669174c99c","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.242012Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:53ca427649bbd27551707921b428e849a0e07015a1dbfcba42ccd8d0b9e2a79b","observation_id":"10e1903c-90c7-426f-995b-544838185480","resolution":{"observed_at":"2026-08-06T11:49:09.692057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.403603Z","title":"Overload: Latency attacks on object detection for edge devices,","venue":null,"work_id":"f9987125-f058-4d48-9b80-dae613147aac","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.376691Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:33ec4eb2b7b51717b3a4c0865125b4400d81ba5c2bccd0dfb8d915fdeada8fcd","observation_id":"5608b035-fdd6-4672-b63f-59ca03ded807","resolution":{"observed_at":"2026-08-06T11:49:09.502931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.212488Z","title":"Survivability analysis of iot systems under resource exhausting attacks,","venue":null,"work_id":"180e2f8f-67e0-494e-a4a9-eb5e6b851fbb","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.465991Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:12fb46723b1b423e871232d23d50fb866bf734366dc23a0b8486c813a784a773","observation_id":"a6165b5e-6e49-4362-a3e9-853ac6e15b6e","resolution":{"observed_at":"2026-08-06T11:49:09.301503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.988533Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"4b4bdef1-39bc-47c9-8dc7-e33033af964f","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.607924Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:b70bcf09d1f3d9c2b216d47966e6f374e183b4bdacdee26584fe314e94b37b73","observation_id":"fafb8e57-56c8-49d3-9db2-644bb179cfe0","resolution":{"observed_at":"2026-08-06T11:49:09.021174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.858995Z","title":"Rgfreq dataset,","venue":null,"work_id":"b9f6b15d-0967-4703-abaa-c8199cd40adf","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.716022Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:bd5c29aebf7cbcf8c73e3b8f8ef694721ae94570c79cbd0281662e28db166dcc","observation_id":"016b78b8-ab9e-4d98-a18b-7bf08acdac9c","resolution":{"observed_at":"2026-08-06T11:49:08.910248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.752675Z","title":"Generative adversarial nets,","venue":null,"work_id":"a47c557b-4758-40d1-b493-81f6b6ae4edb","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.850528Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:fcf541828c822162d635c6ed6f1d5951ee9f4cd097d3f1970ee537df5d635c84","observation_id":"d16e8cf0-7a05-421f-94a4-c67c22d9cc14","resolution":{"observed_at":"2026-08-06T11:49:08.809408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.577816Z","title":"Auto-Encoding Variational Bayes,","venue":null,"work_id":"7e23526b-5ab2-4b7e-a697-bcc87f40aa69","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.976502Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:adde639fc24dea013a9e613dd6d8fe33b5128d4c3e75802868426f67a061b449","observation_id":"50a48247-b1b3-4424-a3f1-c1da1b2a3e75","resolution":{"observed_at":"2026-08-06T11:49:08.669446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:56.069518Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.069518Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:ff08656fd26e2e7934f6bd95585e816c38b590e6eef706b70d9762752c1ee894","observation_id":"57756d8a-5c39-4ef2-8f70-507f57abacf4","resolution":{"observed_at":"2026-08-06T11:48:56.069518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.379342Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"b27762a2-cb0e-4344-8c3b-c5134790d2f8","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.214438Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:7c443dac5bd7bdc48c2048c132a3fd5acd0353dd632857438f03277fae9e13b1","observation_id":"e99e9478-dd8e-4f9d-993e-26d6ba4ddf47","resolution":{"observed_at":"2026-08-06T11:49:08.453305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T11:48:56.317691Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.317691Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:23467268fcbbcad2eafbd56578ee80ae7f2caf48b54f27137d970e11868658ca","observation_id":"3b861ee7-7677-4123-bd13-d60d513f7535","resolution":{"observed_at":"2026-08-06T11:48:56.317691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-06T11:48:56.426876Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.426876Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:015ac6042a1378c3789ad2495b7a3ad1e7a3605fdf2a1fa3b612dcd795a7e96f","observation_id":"f4930038-8f85-41a0-adbc-34278f1dde92","resolution":{"observed_at":"2026-08-06T11:48:56.426876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:56.519554Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.519554Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:dfa19f0488ddf3b177086c017dc7acb6ae5df5a91707e04d5dbd6b7c615bc0d3","observation_id":"5656f597-b103-41dc-aec6-99bee8c603b6","resolution":{"observed_at":"2026-08-06T11:48:56.519554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.149134Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"dbfe1ca6-16c4-455d-80ab-cbfb61e7d61a","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.617676Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:6c523e36d379f1b0e4beee51430181df9def729a74a52825e1bcb6be92511280","observation_id":"e996c045-102e-4fa6-b90a-8d9346c6ddf0","resolution":{"observed_at":"2026-08-06T11:49:08.244527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.820270Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":"a6f0ce60-35e9-4631-9486-a10fa73fd824","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.751710Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:6156f488b73eda203cbd4015440469f1509b07101ad89ec0f56128790a84769c","observation_id":"067e66a3-4702-4c9c-885a-f1c8eba1a388","resolution":{"observed_at":"2026-08-06T11:49:07.968956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T11:48:56.858845Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.858845Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:fc6f493c58ef9520ddce1127722ecfd87adbdf5a2cc9a92abb4ecd08a8e2e102","observation_id":"b6af4463-bb7c-4896-97ea-ce064431e2c7","resolution":{"observed_at":"2026-08-06T11:48:56.858845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T11:48:56.970954Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.970954Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:109d25bf7019fc6421b817374ffe9722cb7ddd3c88ae761a0d762c64909a442b","observation_id":"049ff463-59c0-490d-a62d-cc4a2489ae7f","resolution":{"observed_at":"2026-08-06T11:48:56.970954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.570700Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"4db5c5b6-ba9d-460d-9e61-4787ea57c6f8","year":2016},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.078710Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:83e8bcd1508aee5a0be8e4dfc57d878ef9c5ee71204910e5d34d57a9a4157312","observation_id":"45241410-f1a7-43bd-bba6-56526e0e7326","resolution":{"observed_at":"2026-08-06T11:49:07.705074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:57.214238Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.214238Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:ab0f55a9d5ea9bceaae2d77c84c4e16bf669ac0b295b47b3f4ed3324bf7f343a","observation_id":"160d0fd3-e20d-434d-bad1-06107052b02e","resolution":{"observed_at":"2026-08-06T11:48:57.214238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.250789Z","title":"VQA: Visual question answering,","venue":null,"work_id":"db71eca5-29f5-4090-9af9-6f4c0e7291a2","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.274542Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:e176dd00b815935c71a6cec630e67a43582c137bb7aa20740e8756ea962751db","observation_id":"e03f12c1-c99b-4332-a56a-62c3b6783987","resolution":{"observed_at":"2026-08-06T11:49:07.408065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T11:48:57.401927Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.401927Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a1c1d1c0c905bbcdbd6814f7eb347a1eebba0876eff768d210883db4f2e732c1","observation_id":"6f04ab39-33ee-467e-8d23-bade4cdae6c9","resolution":{"observed_at":"2026-08-06T11:48:57.401927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T11:48:57.486237Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.486237Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:b4fff27abf74ba6fe489da2dbf985e4d863abe53e5af84d27e361bbaf9f5b5e8","observation_id":"3ae7dffa-5f1c-47a3-85d5-8a06d8213297","resolution":{"observed_at":"2026-08-06T11:48:57.486237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04790","last_updated":"2021-04-07T18:43:54Z","snapshot_observed_at":"2026-08-08T18:22:14.110367Z","submitted_at":"2020-05-10T21:31:00Z","title":"The Hateful Memes Challenge: Detecting Hate Speech in Multimodal Memes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04790","snapshot_observed_at":"2026-08-06T11:48:57.553696Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.553696Z"},"links":{"cited_paper":"/paper/2005.04790","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3f9425de0fe6c26253230f8118c217116a1a39b3424791c9d8e1b1feb3b30de2","observation_id":"c417eae8-10df-4850-b83c-aa99fecaa0a1","resolution":{"observed_at":"2026-08-06T11:48:57.553696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.040245Z","title":"Stacked cross attention for image-text matching,","venue":null,"work_id":"109fe5e2-30eb-41ea-9c31-f4b10ee4cfb6","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.611166Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:38ac7cbf5cc5b05eb2d846922b758b82c2104fd655579112ed040b8373512ba9","observation_id":"fc519413-0044-4038-8a1e-5cba545dd609","resolution":{"observed_at":"2026-08-06T11:49:07.131768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.847927Z","title":"Flow straight and fast: Learning to gen- erate and transfer data with rectified flow,","venue":null,"work_id":"85c9ac85-f230-412a-a0fb-a33c815b414d","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.686928Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d68edb74793a3753e1c5aa3cb647cbad8e8971ee1b80c5b4064eca912883128d","observation_id":"ac7ed211-57f0-46c3-a5e0-f35d2f2e9c74","resolution":{"observed_at":"2026-08-06T11:49:06.959729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T11:48:57.768485Z","title":"Qwen-VL: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.768485Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3e996688a3726f693aa23173679679bb1a17db9a4023381d42dabb947445b68c","observation_id":"05223133-1046-405e-8c29-7dba480fc75e","resolution":{"observed_at":"2026-08-06T11:48:57.768485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:48:57.846255Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.846255Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:79a04a7b9f02346c1e0e9a68019bebc6fd4b63e3b9c050a20cf2e499e22801fc","observation_id":"947eb8e7-0bf3-4c46-af62-4d2abfe25553","resolution":{"observed_at":"2026-08-06T11:48:57.846255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T11:48:57.919979Z","title":"PaliGemma: A versatile 3b VLM for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.919979Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3359383bbf683d56282c9c7fbd794b938746bf2bf7fe694e7c2edb63aefe8495","observation_id":"e05920c8-ae1b-44ca-8bf9-7c8c4e00742d","resolution":{"observed_at":"2026-08-06T11:48:57.919979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.668931Z","title":"Learning Rich Features for Image Manipulation Detection,","venue":null,"work_id":"c3917f9c-20d8-4448-ae60-4f01c061b660","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.996645Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:691758c6371248e9bd50590c7edae93a47eaa1cf68123a85f2681d02d41891d9","observation_id":"8bff78c8-6dd2-4631-9f2a-5dd7a507ecdc","resolution":{"observed_at":"2026-08-06T11:49:06.745194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.530451Z","title":"FaceForensics++: Learning to Detect Manipulated Facial Images,","venue":null,"work_id":"b5e53bf6-b736-444c-808b-25863e46682e","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.056528Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:93b604d10b5605d98d26edbc2101b933b48756f1bd9d340a19cf2234c1e63148","observation_id":"51705b55-fca9-4cd7-9b43-01753069d571","resolution":{"observed_at":"2026-08-06T11:49:06.603598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-06T11:48:58.098243Z","title":"The DeepFake Detection Challenge (DFDC) Dataset,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.098243Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:711ca882ffe03ff57f33f4f065028a2deb87b65e9daac638d212946555ffce04","observation_id":"451ffb2b-8583-4fbe-9b4b-193e5ae202e0","resolution":{"observed_at":"2026-08-06T11:48:58.098243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.389535Z","title":"Detecting images generated by diffusers,","venue":null,"work_id":"9456daa2-b71f-43fc-b12b-23b82eb93453","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.171704Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c51c26a16f89f120040c63ac2edb7d55a96279d3c50eeba620aca6220d6a975d","observation_id":"bb25fbc3-6408-4605-8d91-6f958542493e","resolution":{"observed_at":"2026-08-06T11:49:06.449194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.281328Z","title":"DIRE: Diffusion Reconstruction Error for Diffusion-Generated Image Detection,","venue":null,"work_id":"846ade62-9607-400b-a839-95f71ec63e63","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.247670Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:9714189cf01243f9effb6ee34dc2bb308dbbaf73c54505f1ac28cb98079342de","observation_id":"f2cea482-b55b-43d1-ab48-f162c7f83aff","resolution":{"observed_at":"2026-08-06T11:49:06.312019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-07T17:29:40.662418Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-08-06T11:48:58.304025Z","title":"Deepfake-eval-2024: A multi-modal in-the-wild benchmark of deepfakes circulated in 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.304025Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:e64664274d6af8279851c27c6c3f3e127672dd3ffb492429704207a8ab6d9864","observation_id":"06486be9-681b-4c88-83bc-174cc7e0d1b8","resolution":{"observed_at":"2026-08-06T11:48:58.304025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.053387Z","title":"Synth- Buster: Towards Detection of Diffusion Model Generated Images,","venue":null,"work_id":"b7273b06-3926-4bbd-881f-74dcb323f1e1","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.421807Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:84cf4cbfaa323950b289a8faf7db556284a47bcad1bcfd9f26dacbbe34c291ad","observation_id":"25bf8b96-e077-40c7-aaa1-7b61f56a2211","resolution":{"observed_at":"2026-08-06T11:49:06.153667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.898911Z","title":"Llms are not yet ready for deepfake image detection,","venue":null,"work_id":"62f8e6bb-74e7-499f-b994-b6f2ff32e12d","year":null},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.501192Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:b4dd0effca17a79cebd9b6b4d752edeb2edfb51e727e801d07308e4bfbb768bd","observation_id":"01f13274-0160-432a-827f-235708356229","resolution":{"observed_at":"2026-08-06T11:49:05.950694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.720835Z","title":"Intriguing properties of neural networks,","venue":null,"work_id":"a7c0ac57-1b98-4ade-b778-d2638dad3678","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.627977Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:cba3566a00a7bdc40a500ae4df9deec208582afff060823e23ebc2c3069bfbde","observation_id":"e3f4bb67-701f-4c69-bd68-f2216bdd35c8","resolution":{"observed_at":"2026-08-06T11:49:05.827605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.543898Z","title":"Explaining and harnessing adversarial examples,","venue":null,"work_id":"a267a909-4910-4d1f-b4be-aeb74bb41d5a","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.690240Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f8b3a1b75050b5d941c225b0aeda929617ca6ccc9976173a45fa3860453cd843","observation_id":"8f0c9823-107c-4e67-a115-801a554765f0","resolution":{"observed_at":"2026-08-06T11:49:05.625289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.337907Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":"f9ec999e-7af9-4230-b8a8-657daeee81a7","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.755851Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:263dc4a1c6b7518cc0cddf80916df08cc9e10368e458b9d38eff24e684386758","observation_id":"a186785b-8188-426c-8f09-c83e788b7fb9","resolution":{"observed_at":"2026-08-06T11:49:05.426881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.153880Z","title":"Adversarial vqa: A new benchmark for evaluating the robustness of vqa models,","venue":null,"work_id":"29727779-3941-4ba8-89f1-9660a4e6a48d","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.827962Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:35ad1a1bf4f0cc4dcf08f95621f605f0ad8d1a094ed72e85f591264f0446e6aa","observation_id":"ede04c7d-91bd-478b-8bea-cbdb0fac0d2b","resolution":{"observed_at":"2026-08-06T11:49:05.247004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.991881Z","title":"Attacking vqa systems via adversarial background noise,","venue":null,"work_id":"6e43d19c-16a2-4934-9989-33199510a976","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.890444Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0d2ca52f3951c0e4b001cddac8037aa62d194348c28db5ee5b5028a579226839","observation_id":"eab56efe-9611-4166-a34c-2b7548b0e96e","resolution":{"observed_at":"2026-08-06T11:49:05.069052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.867590Z","title":"On evaluating adversarial robustness of large vision-language models,","venue":null,"work_id":"ce11f2e1-095f-481e-97a4-20fb1e63f50a","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.960847Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:593b58618a20c7a1821d08ea5fff1f1cafc22510f408cd3a3fae3bac8ccd64c4","observation_id":"8213d409-3c2a-4eb3-b7bb-863c849af378","resolution":{"observed_at":"2026-08-06T11:49:04.916129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.724869Z","title":"Mutual-modality adversarial attack with semantic perturbation,","venue":null,"work_id":"bbffbdd4-b32e-4b76-bb08-2ad1ec07e6cc","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.036047Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:1273d95af542f06aa2d473c69cdacf65cdada302e165d65f26e9341590cfacbb","observation_id":"2bc95700-2598-4af3-b982-db7496d87ff4","resolution":{"observed_at":"2026-08-06T11:49:04.797875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.519367Z","title":"Frequency-driven imperceptible adversarial attack on semantic similarity,","venue":null,"work_id":"752b2509-3eb7-4ae8-960a-efa6277eccd8","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.102680Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:06430146633a47d751ce8ad7f76bdd18070de4478e42a1f4b0264cc95d98b8b4","observation_id":"4d040643-f66b-40e6-8299-4abb08bc0f2a","resolution":{"observed_at":"2026-08-06T11:49:04.606945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.261268Z","title":"Facl-attack: Frequency-aware contrastive learning for transferable adversarial attacks,","venue":null,"work_id":"5f9da6dd-2405-4313-8de6-5223c0e16e2f","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.169362Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:370936eb950efcf8a0cb49ad8745bbcefb3b605678c2227aa4104edbc9ffcd2c","observation_id":"d23d115c-d627-4fd2-9dd9-0b062b20e408","resolution":{"observed_at":"2026-08-06T11:49:04.398946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.042614Z","title":"AdvDiff: Generating unrestricted adversarial examples using diffusion models,","venue":null,"work_id":"458e479a-d9d0-4ebf-bec0-22c8dd609764","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.238624Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4505cba8daafc75b7565b69af61a4149fee0b43eb996b25525b3ffa7a34f5caa","observation_id":"6fd93d75-641a-4037-86a5-ef45924d9ebb","resolution":{"observed_at":"2026-08-06T11:49:04.134539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.803315Z","title":"Sita: Structurally imperceptible and transferable adversarial attacks for stylized image generation,","venue":null,"work_id":"0f7fa4e4-6061-4c40-801d-7ed382aa0432","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.288345Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a67f52cb8e71dd26f583c4eff0af5fd9d388d5b773b066e392b78aa9bb9decd8","observation_id":"48bef1b1-7e8e-4194-a705-2caf1677909d","resolution":{"observed_at":"2026-08-06T11:49:03.905311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.558863Z","title":"Toward transferable attack via adver- sarial diffusion in face recognition,","venue":null,"work_id":"5d9df402-5e55-4f1c-8da9-fd0277e95adb","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.357291Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:97c303709117dbf76c46e51d6e9c07f0cc6da303618937421bb1dd60e027999f","observation_id":"8da632b0-7948-4b03-abd1-5ddc62ed65c0","resolution":{"observed_at":"2026-08-06T11:49:03.699649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.334376Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"3d6d9a6d-4e91-4376-865b-829b48a4761c","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.427787Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:111c1a69e4f4e8f9a3969740d8efa83753200363797cef69bb833fa1789ef04b","observation_id":"4e2e9ca7-a281-4788-a8fa-6d7acdd0246c","resolution":{"observed_at":"2026-08-06T11:49:03.458002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.093188Z","title":"Imagenet-trained cnns are biased towards texture; in- creasing shape bias improves accuracy and robustness,","venue":null,"work_id":"0788c067-0a4e-43c5-a6e4-3ff3cdc79fb8","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.499875Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:177c51d68c4cc0212bbb20271ae5fc6e6a6f01ff27e14fab6926a9730f0b3acd","observation_id":"78db761b-45a7-4d8c-93c3-bea51dac1d77","resolution":{"observed_at":"2026-08-06T11:49:03.211391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.897881Z","title":"Spatial frequency analysis in the visual system,","venue":null,"work_id":"492512bc-32ac-427c-8731-4a902648f281","year":1985},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.569224Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:762e03b3cd334776c7ca79a0255c5ce8a36ec9bae2ffe37b1d0ca07f478908f7","observation_id":"fb8349c0-5713-4d9d-b5d4-d6c9137209f0","resolution":{"observed_at":"2026-08-06T11:49:02.986444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.711764Z","title":"Distinct spatial frequency sensitivities for processing faces and emotional expressions,","venue":null,"work_id":"0d73b51e-acd9-41e2-84b4-4d61276f72b3","year":2003},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.646587Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:76dedacedc45eaae09b553b18f47462bac680f32e15170935343128e0ea7a136","observation_id":"bb4613a0-1ba0-428d-b6af-978c1f3901b9","resolution":{"observed_at":"2026-08-06T11:49:02.799194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.480599Z","title":"Introducing stable diffusion 3.5,","venue":null,"work_id":"759462a9-9e03-4c42-abce-8ad4ec35e71b","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.709172Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:cef85ca09d49cedac4a047780972e7fd98caffdb20f2c60eef78cf824ff91694","observation_id":"2f1bcce0-e886-4524-b53e-dce94988428c","resolution":{"observed_at":"2026-08-06T11:49:02.589285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.247621Z","title":"Stable imagenet-1k dataset,","venue":null,"work_id":"0038314a-9cef-40a3-9411-7141ee872980","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.888849Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:cf6c451c979204933d73a2bb41c0b2975b2e89eafb359b779cbbaf47d48f8d5c","observation_id":"6861587b-27af-4e91-bb7c-596506ac0055","resolution":{"observed_at":"2026-08-06T11:49:02.354294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14126","last_updated":"2023-03-24T16:33:06Z","snapshot_observed_at":"2026-07-06T15:07:41.634914Z","submitted_at":"2023-03-24T16:33:06Z","title":"CIFAKE: Image Classification and Explainable Identification of AI-Generated Synthetic Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14126","snapshot_observed_at":"2026-08-06T11:49:00.019238Z","title":"Cifake: Image classification and explain- able identification of ai-generated synthetic images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.019238Z"},"links":{"cited_paper":"/paper/2303.14126","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:55a3947ac8c9d7503c999f0a4af74cac5b2859d7604c3bd0bb234b4b06f977e0","observation_id":"e309ae7e-7ceb-4281-b87f-e04b1c33dabc","resolution":{"observed_at":"2026-08-06T11:49:00.019238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.048860Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"f68c6992-d0c2-44b3-89db-f8f16f8acc00","year":2009},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.111949Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f602b623887ae00a59cbbe55bfe7ac22edcf4956234c65ff146adb76e6608ed6","observation_id":"0917d9f0-2a56-4e18-9b27-bcd0cb0ccb0a","resolution":{"observed_at":"2026-08-06T11:49:02.136374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.838037Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":"612fec88-f079-4343-a880-86c8ed78098d","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.204015Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:e9996556d29f5ba7781a9b2cbe7589406c4084178f2f5e365a4c92c6f58c6315","observation_id":"c6b4b5cc-7335-47a3-977e-f1d3d80ce43d","resolution":{"observed_at":"2026-08-06T11:49:01.934927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.637590Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"40617d0f-bdc4-4ad1-b987-7668e9ee1054","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.382782Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:73675bbb77d997a4c4208e0b1fe47c72a6d6a37dafc100397a622f042d1e4657","observation_id":"3739c272-1042-49df-bc10-9049d4ae9d35","resolution":{"observed_at":"2026-08-06T11:49:01.717093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.336473Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":"60f12388-bc99-4807-a0ce-ee26b7a36982","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.493287Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:71597c3c8c98754dfc98bd6b6f9d553644f2849905f0816db9015486d49819c4","observation_id":"cfdbfdc5-2132-4c87-bcc9-7c87b37b8eff","resolution":{"observed_at":"2026-08-06T11:49:01.491036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.107649Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":"bea0f00f-01d4-4d14-b05f-d80283ee6278","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.597773Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2ac58dae05ec83f17f2d95626318939a9b5d88749cf184b188a3b13bd8b7fd7c","observation_id":"b4d1bede-e084-412d-ac24-69779f4bf2e0","resolution":{"observed_at":"2026-08-06T11:49:01.226733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:00.730675Z","title":"Qwen2.5-vl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.730675Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0e63bdd1d379d856b12783e49abb71389b1ca6fd1049e643212e697aab2ec52a","observation_id":"0dfd9bf2-eb4c-478b-a725-fba423b2746c","resolution":{"observed_at":"2026-08-06T11:49:00.730675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10474","last_updated":"2025-06-12T08:27:24Z","snapshot_observed_at":"2026-08-07T20:35:28.359427Z","submitted_at":"2025-06-12T08:27:24Z","title":"LLMs Are Not Yet Ready for Deepfake Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10474","snapshot_observed_at":"2026-08-06T11:48:58.556863Z","title":"Available: https://arxiv.org/abs/2506.10474","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.556863Z"},"links":{"cited_paper":"/paper/2506.10474","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:9704dbaf65a629831c57f2ae593612885476332c7363d7153ae0d00437177150","observation_id":"fe2e8c30-7841-40ba-802c-261fa120293d","resolution":{"observed_at":"2026-08-06T11:48:58.556863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:52:44.801881Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2507.22398."}