{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:431ebba3f1a01ea73f63ecc024b35cd64806418d14cf05dd6aed8baf1090b18d","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:37.174665Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:58:28.202606Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:31:05.046964Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"cited_work":{"arxiv_id":"2505.24227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24227","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"12f6a2aa-be18-45cb-ba3b-bad8df2a5ba5","year":2025},"citing_paper":{"arxiv_id":"2604.12833","last_updated":"2026-04-14T14:52:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:52:15Z","title":"Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:58:28.202606Z"},"links":{"cited_paper":"/paper/2505.24227","citing_paper":"/paper/2604.12833"},"observation_digest":"sha256:60d3ab889d593c8e74608cf8a87cf3b0db330ceb43fde14c440bc74d683e1639","observation_id":"ab4d6459-03a9-46c2-b864-be24593e8fb0","resolution":{"observed_at":"2026-05-11T09:31:05.052907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24227/citation-record","integrity":"/paper/2505.24227/integrity","json":"/paper/2505.24227/citation-record.json","paper":"/paper/2505.24227"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03050","last_updated":"2021-07-07T07:22:41Z","snapshot_observed_at":"2026-08-09T16:07:13.311721Z","submitted_at":"2021-07-07T07:22:41Z","title":"Controlled Caption Generation for Images Through Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03050","snapshot_observed_at":"2026-08-07T12:35:34.858781Z","title":"Con- trolled caption generation for images through adversarial attacks.arXiv preprint arXiv:2107.03050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:34.858781Z"},"links":{"cited_paper":"/paper/2107.03050","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:1262dae277b368eb19f53de290be538a20ae38316c618c4981a0e6a65ce47f87","observation_id":"96877b59-a946-49e9-81a3-54fa8c3eed8d","resolution":{"observed_at":"2026-08-07T12:35:34.858781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11940","last_updated":"2024-12-11T22:32:49Z","snapshot_observed_at":"2026-08-09T04:32:13.278683Z","submitted_at":"2024-02-19T08:27:23Z","title":"AICAttack: Adversarial Image Captioning Attack with Attention-Based Optimization","version":4},"cited_work":{"arxiv_id":"2402.11940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11940","snapshot_observed_at":"2026-08-07T12:35:37.298481Z","title":"AICAttack: Adversarial Image Captioning Attack with Attention-Based Optimization","venue":"cs.CV","work_id":"1f1e3349-eddd-4ee7-abf8-58e7a54e6cbe","year":2024},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.991885Z"},"links":{"cited_paper":"/paper/2402.11940","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:ea4a1fcbe47053191bcf635493a7df038cde0647d03b924d6ede788ccb57ddfd","observation_id":"471cbf59-d131-4b80-8c97-d3783b4df21e","resolution":{"observed_at":"2026-08-07T12:35:37.349893Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-10T05:13:08.988270Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-07T12:35:36.557475Z","title":"and Bansal, M","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.557475Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:deb3e9a6270c19f65f45bc10f56ed35696626b62c13efbb4b63fbd56a025d41e","observation_id":"438c66c2-4e98-4e3b-b30a-6a4730ea0a76","resolution":{"observed_at":"2026-08-07T12:35:36.557475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.479930Z","title":null,"venue":null,"work_id":"144c9688-d335-4321-a3eb-cfd33647986d","year":2025},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.636443Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:6a266cfe6ea246a941484b8d1cf522354722cc598d0222b5a7898623b562709a","observation_id":"70145193-9325-469e-be29-ff284fd76d58","resolution":{"observed_at":"2026-08-07T12:35:38.631733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.333728Z","title":"During the optimization procedure, let Ii denote the generated adversarial image at the ith step","venue":null,"work_id":"4f2937d7-c67b-4be7-890a-6125fb2a4001","year":2014},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.737324Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:88bf096a8ffa69ead51189eb0db4f3d59c969c28e3241ab009c97ecff33a0a47","observation_id":"f85a36c9-787c-4b5f-8d7e-01acd4b2bcee","resolution":{"observed_at":"2026-08-07T12:35:38.399856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.935808Z","title":null,"venue":null,"work_id":"678a3c22-f89f-4686-86ec-4098415c7ff0","year":2018},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.957128Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:2cf08bd353ff0172b6ef0c3ccda1c094cc6f08a1225e37e90de0b7f68111ad8f","observation_id":"c4cac3ac-6a5b-485c-bfd3-b6b516853df9","resolution":{"observed_at":"2026-08-07T12:35:38.025899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.731140Z","title":null,"venue":null,"work_id":"eddc1de5-89cb-4d3f-8ea6-555a74abc80f","year":2021},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:37.055647Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:8c0a13869fe33a551bd30224dbf5b9e5f56960c5b5a8b004dbde092001b87994","observation_id":"d132cbeb-ebc9-4e8a-a7a6-70314acf16b1","resolution":{"observed_at":"2026-08-07T12:35:37.815825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.587259Z","title":"APA measures the percentage of successful prediction answers among all the images","venue":null,"work_id":"47b3ca72-4eee-4d0d-8126-220b12ee44d0","year":2012},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:37.174665Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:147a27d53055855037513f6197d2d1d8798d70ab6b7b388242ae9e8af5777dc3","observation_id":"8413f760-3128-46a4-bb36-7b2cd7a9db1c","resolution":{"observed_at":"2026-08-07T12:35:37.631326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15221","last_updated":"2022-10-27T07:16:30Z","snapshot_observed_at":"2026-08-06T18:29:44.124523Z","submitted_at":"2022-10-27T07:16:30Z","title":"TASA: Deceiving Question Answering Models by Twin Answer Sentences Attack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15221","snapshot_observed_at":"2026-08-07T12:35:34.960220Z","title":"TASA: Deceiving question answering mod- els by twin answer sentences attack.arXiv preprint arXiv:2210.15221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:34.960220Z"},"links":{"cited_paper":"/paper/2210.15221","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:73897e94d3a4991945e7b2b8dba4c3a5c2706ac9cd140a43c4598ffeb2f6fc79","observation_id":"5f2c3ffc-f350-41ea-9935-df696ddb5742","resolution":{"observed_at":"2026-08-07T12:35:34.960220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-10T13:00:45.507281Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:35:36.351321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.351321Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:992f16223c93891e50194eb01c1d08393c479234e7768b49cf08892e7d3a2626","observation_id":"22bc1e94-042a-402c-aa38-1f117cddb53e","resolution":{"observed_at":"2026-08-07T12:35:36.351321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.146693Z","title":"In this study, we randomly choose 1,000 images from the test set of the above datasets as clean images to craft adversarial examples","venue":null,"work_id":"30440b38-f7fd-44d7-813a-e576413690e4","year":2023},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.862764Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:be0fbcf11b18d1ca79b25cb64a3d3b953edb2548e86f079a40682c048b243390","observation_id":"ffba26f6-b460-4727-8216-1ab2f21a672f","resolution":{"observed_at":"2026-08-07T12:35:38.234101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20090","last_updated":"2025-07-21T08:41:47Z","snapshot_observed_at":"2026-08-09T04:31:41.282578Z","submitted_at":"2024-05-30T14:27:20Z","title":"Transfer Attack for Bad and Good: Explain and Boost Adversarial Transferability across Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20090","snapshot_observed_at":"2026-08-07T12:35:35.084001Z","title":"Typography leads semantic diversifying: Amplify- ing adversarial transferability across multimodal large lan- guage models.arXiv preprint arXiv:2405.20090,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.084001Z"},"links":{"cited_paper":"/paper/2405.20090","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:946f3dc685e28c6aa13966605b94d07173173dbab8b0bf7af3bab9bca5b081ba","observation_id":"f60c9835-8292-467e-adf1-c4af10ca95ea","resolution":{"observed_at":"2026-08-07T12:35:35.084001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17626","last_updated":"2024-05-02T00:08:36Z","snapshot_observed_at":"2026-07-06T16:39:08.850847Z","submitted_at":"2023-10-26T17:45:26Z","title":"A Survey on Transferability of Adversarial Examples across Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17626","snapshot_observed_at":"2026-08-07T12:35:35.411237Z","title":"A survey on transferabil- ity of adversarial examples across deep neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.411237Z"},"links":{"cited_paper":"/paper/2310.17626","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:cb5b00c69e95b0280482b07e1326aa11ba3219ea6fe04bc8a8d69b44b43a70c5","observation_id":"bd228681-debf-4fbd-884c-44a6458b6f6d","resolution":{"observed_at":"2026-08-07T12:35:35.411237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.725136Z","title":"S., Oh, C., and Cavallaro, A","venue":null,"work_id":"da03faf1-4ecf-4aeb-8302-062d0f6cab6a","year":1902},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.415446Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:d2c8e0a5342ceb529eaaa6f48148e22a37371cf5c13d2777a3f163b3882ad7ba","observation_id":"5699b861-47e4-4f3f-97d4-bcb9eaa6e1f2","resolution":{"observed_at":"2026-08-07T12:35:38.788221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04403","last_updated":"2023-12-07T16:16:50Z","snapshot_observed_at":"2026-08-10T00:33:03.494304Z","submitted_at":"2023-12-07T16:16:50Z","title":"OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04403","snapshot_observed_at":"2026-08-07T12:35:35.568500Z","title":"OT-Attack: Enhancing adversarial transferability of vision-language models via optimal transport optimiza- tion.arXiv preprint arXiv:2312.04403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.568500Z"},"links":{"cited_paper":"/paper/2312.04403","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:6dc6551716581c103d1006b65530058f5cbf460fe98ec353aa999b5264736844","observation_id":"87da1941-05b3-4541-bca0-b79fd8f91043","resolution":{"observed_at":"2026-08-07T12:35:35.568500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04913","last_updated":"2023-12-08T09:08:50Z","snapshot_observed_at":"2026-08-07T21:16:58.470052Z","submitted_at":"2023-12-08T09:08:50Z","title":"SA-Attack: Improving Adversarial Transferability of Vision-Language Pre-training Models via Self-Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04913","snapshot_observed_at":"2026-08-07T12:35:35.832321Z","title":"SA- Attack: Improving adversarial transferability of vision- language pre-training models via self-augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.832321Z"},"links":{"cited_paper":"/paper/2312.04913","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:0c553ec784419e7724e9f0d4961591e667ab9c556459ef003943e3a86720d34f","observation_id":"94ac1984-3a7a-4856-a826-f280259693f9","resolution":{"observed_at":"2026-08-07T12:35:35.832321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.907718Z","title":"Adversarial VQA: A new benchmark for evaluating the robustness of VQA models","venue":null,"work_id":"9e344104-fb94-4dfc-a5ba-5cd78966a0ab","year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.205207Z"},"links":{"citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:9c01b186b2326e4c8f6cdf3eb075271f2e7fdc4c04975cfab3c700c1301f7716","observation_id":"b3c11b9b-a659-4a2e-9bf5-d6e7fd6315e6","resolution":{"observed_at":"2026-08-07T12:35:38.976559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06732","last_updated":"2018-07-20T01:57:37Z","snapshot_observed_at":"2026-08-03T00:10:21.477247Z","submitted_at":"2018-07-18T01:17:27Z","title":"Motivating the Rules of the Game for Adversarial Example Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06732","snapshot_observed_at":"2026-08-07T12:35:35.259685Z","title":"P., Goodfellow, I., Andersen, D., and Dahl, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:35.259685Z"},"links":{"cited_paper":"/paper/1807.06732","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:c0d013689880e278e57da02ada6bb832d6817839975016272056545bdb2a4178","observation_id":"6218c211-9f0b-4491-a79a-0356d7360607","resolution":{"observed_at":"2026-08-07T12:35:35.259685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:31:57.285135Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2505.24227."}