{"as_of":"2026-08-12T11:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:125e58e0ebf1d8aea727566ffbce43106be39258e2e290406c2d8e43ac336b48","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:00:13.103101Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10353/citation-record","integrity":"/paper/2412.10353/integrity","json":"/paper/2412.10353/citation-record.json","paper":"/paper/2412.10353"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.586083Z","title":"Deep neural rejection against adver- sarial examples,","venue":null,"work_id":"67fcc973-27af-44c3-a3fe-650b0b101fa2","year":2020},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.013540Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:e238f5d1ea4b1640d64570823f7fa462e492e50af70da9a7ff57446013003f86","observation_id":"7c8f0814-7449-4a9f-af37-ed9a0d5a9160","resolution":{"observed_at":"2026-08-11T16:00:13.594571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14713","last_updated":"2022-11-18T10:12:11Z","snapshot_observed_at":"2026-08-11T13:50:02.370614Z","submitted_at":"2022-03-28T13:00:01Z","title":"Image-text Retrieval: A Survey on Recent Research and Development","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14713","snapshot_observed_at":"2026-08-11T16:00:13.040800Z","title":"Image-text retrieval: A survey on recent research and development,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.040800Z"},"links":{"cited_paper":"/paper/2203.14713","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:d6da3232f2a7a6b558199d843972596ee360a0a1e70a070b0eff5d94c157287c","observation_id":"84bb4307-1660-44c8-8125-eb2f712e35f7","resolution":{"observed_at":"2026-08-11T16:00:13.040800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00522","last_updated":"2024-07-08T02:48:27Z","snapshot_observed_at":"2026-08-11T22:02:20.960260Z","submitted_at":"2024-03-01T13:30:51Z","title":"VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00522","snapshot_observed_at":"2026-08-11T16:00:13.052533Z","title":"Visionllama: A unified llama interface for vision tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.052533Z"},"links":{"cited_paper":"/paper/2403.00522","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:61769bf433bdab85b7e8046ceaafa304de0aea5ea184cd0417a366f242d0ea22","observation_id":"60c69d0f-88ce-4201-a803-ab13abd4585b","resolution":{"observed_at":"2026-08-11T16:00:13.052533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06705","last_updated":"2019-02-20T17:38:32Z","snapshot_observed_at":"2026-08-02T02:05:14.321072Z","submitted_at":"2019-02-18T18:18:27Z","title":"On Evaluating Adversarial Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06705","snapshot_observed_at":"2026-08-11T16:00:13.059287Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.059287Z"},"links":{"cited_paper":"/paper/1902.06705","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:26f3310d2d7c02a4ce64fb607df337f9c9b2e35854ea3a6b59eb998cc64b53fc","observation_id":"f0282e34-d82e-4341-a3d1-f10c78907782","resolution":{"observed_at":"2026-08-11T16:00:13.059287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.506542Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":"53e5df37-9c34-43c0-9aaf-55fd42612b77","year":2011},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.070621Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:75e81d913253f8698368279f4139315b05316bd35fd1f4c3f0858ba7b14e78f4","observation_id":"e3767c66-8306-4766-8642-51167b2a8c16","resolution":{"observed_at":"2026-08-11T16:00:13.515652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.480709Z","title":"Improving robustness using generated data,","venue":null,"work_id":"9db0d28e-61d5-423d-871d-fdb80e2ae926","year":2021},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.075645Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:b059a8a728979d46cf1c6fab0124787c0aae69e3a0af22b0999b00c535a027c2","observation_id":"86033ae1-2dec-4428-966e-2f14dc0b4370","resolution":{"observed_at":"2026-08-11T16:00:13.487170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.456375Z","title":"Adversarial robustness: From self-supervised pre-training to fine-tuning,","venue":null,"work_id":"ed540446-68f9-4158-875a-0152dc709e5e","year":2020},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.082583Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:8a5cfde7651cb3a6c67177a8a4067186d8d692f6168290797802eabcbc9e8263","observation_id":"a80416b1-e043-4b94-a4d2-fdf6bd256249","resolution":{"observed_at":"2026-08-11T16:00:13.465157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.088859Z","title":"Fusionbench: A comprehensive benchmark of deep model fusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.088859Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:511278e257a0ca84e1050c2031b995cf8805afd330bc6df96306b6c10d10207b","observation_id":"dc5aa641-55d7-47b6-9234-ac34f1b736b7","resolution":{"observed_at":"2026-08-11T16:00:13.088859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15658","last_updated":"2023-06-27T17:51:06Z","snapshot_observed_at":"2026-08-03T00:57:50.686707Z","submitted_at":"2023-06-27T17:51:06Z","title":"CLIPA-v2: Scaling CLIP Training with 81.1% Zero-shot ImageNet Accuracy within a \\$10,000 Budget; An Extra \\$4,000 Unlocks 81.8% Accuracy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15658","snapshot_observed_at":"2026-08-11T16:00:13.094737Z","title":"Clipa-v2: Scaling CLIP training with 81.1% zero-shot imagenet accuracy within a $10, 000 budget; an extra $4, 000 unlocks 81.8% accuracy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.094737Z"},"links":{"cited_paper":"/paper/2306.15658","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:04a130525fc22cca82eb6ad65a8f1ca87e43351e6311abeb3c34b7355be20b4b","observation_id":"2a39b60f-6d87-4c68-baa6-66f024898cab","resolution":{"observed_at":"2026-08-11T16:00:13.094737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-11T16:00:13.103101Z","title":"Huggingface’s transformers: State-of-the-art natu- ral language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.103101Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:6e7980abb9fb40ea0ba5629c82b163ae35109c2938db4ded3707eba1a3eabb65","observation_id":"dac85a6e-423f-41a1-9f33-3bb62ac9547f","resolution":{"observed_at":"2026-08-11T16:00:13.103101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.537265Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":"e3ff850d-46f8-4dd6-8ead-c6b897516f56","year":2004},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.065711Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:02cc7c008e6a9a9280a3a041071225f48f6a7762b4f8dfaa8c9be371f0b3a375","observation_id":"28b0a0ed-11a8-435c-964a-785d74169182","resolution":{"observed_at":"2026-08-11T16:00:13.544798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.668442Z","title":"Towards evaluating the robustness of neural networks,","venue":null,"work_id":"a092b6ed-a26b-40f5-b659-d101dba6c10d","year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.984402Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:8c4fd5580ed83e101c2ac06e47347f39e48fab6baeeea44ae0a8e2821bbaf112","observation_id":"460ee490-2aec-4398-95b3-c508bebe017f","resolution":{"observed_at":"2026-08-11T16:00:13.675015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-11T16:00:13.002316Z","title":"Towards deep learning models resistant to adver- sarial attacks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.002316Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:15c83d336cd9af4ccb435e228da9d067d03b26b6b50a2e23283af545c376fa45","observation_id":"775bfcc7-9d62-4945-ab92-753b48169323","resolution":{"observed_at":"2026-08-11T16:00:13.002316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.607561Z","title":"Safetynet: Detecting and rejecting adversarial examples robustly,","venue":null,"work_id":"832eb879-af52-4a3b-8446-67584ec3a8c0","year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.008087Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:a0fa5b2a4a3af6f04f7033654bcde06dd20addd5481423731d73c234c9496d3d","observation_id":"aacb442f-a626-47a5-8a97-f93dd6079843","resolution":{"observed_at":"2026-08-11T16:00:13.613574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T16:00:13.029837Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.029837Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:ca9657e59f54c8dac9418cbb247338788ae0daf6203322a59211bc507dcee905","observation_id":"970b03d7-ed8a-40c4-9025-18827242f426","resolution":{"observed_at":"2026-08-11T16:00:13.029837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.560159Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"43a34d5b-0a84-4c87-9fe8-5849c592d891","year":2021},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.019822Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:fb46ef8b94e889e46843b3fe3165e73efe67f4bfb3459a7154f9868394dcd1c7","observation_id":"8f44f540-b9c8-4e4d-968c-17fa362054f7","resolution":{"observed_at":"2026-08-11T16:00:13.566416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.839524Z","title":"Evasion attacks against 8 machine learning at test time,","venue":null,"work_id":"f7a334b0-d6ff-4454-bd6e-2c9f268a202f","year":2013},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.977010Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:252141bcaed7df979b5b38949e69265a2114745c7efb7aa9e2317eef20a8e481","observation_id":"9ae533e3-f133-4521-a039-162509643c0a","resolution":{"observed_at":"2026-08-11T16:00:13.845651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.626214Z","title":"Wild patterns: Ten years after the rise of adversarial machine learning,","venue":null,"work_id":"7fef975e-7ff7-45f6-b98b-ac4a4dbb4da1","year":2018},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.997383Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:6cceb1d9963f840f913b4d2e973eb883a0ad89b80cf84c540ba13a1aedeb4dfb","observation_id":"6e033151-2dd2-4d03-ae19-fb02cfd3de9e","resolution":{"observed_at":"2026-08-11T16:00:13.633314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-11T16:00:13.046276Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.046276Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:cecc8a01a467332fa8d371529195fbb09ff86aae60a864df7cfc79935dafe7ff","observation_id":"4f7405e4-7fd0-4d69-acee-cdab0767910a","resolution":{"observed_at":"2026-08-11T16:00:13.046276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-07-06T12:40:27.042790Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-11T16:00:13.035351Z","title":"A survey of vision- language pre-trained models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.035351Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:2e739a1416ec161f7948f01d3fd076a760fd159ad4f6947ebb0398cfa511b12b","observation_id":"1edc973a-b1b2-42cc-89e4-663c6096cc65","resolution":{"observed_at":"2026-08-11T16:00:13.035351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04765","last_updated":"2018-03-13T13:02:13Z","snapshot_observed_at":"2026-07-06T06:28:00.254252Z","submitted_at":"2018-03-13T13:02:13Z","title":"Deep k-Nearest Neighbors: Towards Confident, Interpretable and Robust Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04765","snapshot_observed_at":"2026-08-11T16:00:13.024471Z","title":"Towards open set deep networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.024471Z"},"links":{"cited_paper":"/paper/1803.04765","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:0b0b87e59d254e4157975fe3cd0381190f0dc64ca511ef3d6fe78b43a09de8ef","observation_id":"93b7f950-d061-4b8f-a711-164aab124dc5","resolution":{"observed_at":"2026-08-11T16:00:13.024471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.648473Z","title":"Attackbench: Evaluating gradient-based attacks for adversarial examples,","venue":null,"work_id":"9e903238-e4c9-437e-8b94-6552eda09307","year":2025},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.992098Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:bc21711266d91f0c5a39bbc7238b8a3091958ab183f28d074aaa4a8acbd0f763","observation_id":"10eed4f2-559b-4a97-a16a-7e7067022bdc","resolution":{"observed_at":"2026-08-11T16:00:13.654844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2412.10353."}