{"as_of":"2026-08-11T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35c65f1670bfdb58e4d09ce4e62293e63660fadf17817d67105b158a75237dbe","coverage":[{"denominator":270,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:26:35.341966Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:22:35.055073Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:22:35.279421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"cited_work":{"arxiv_id":"2501.12203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12203","snapshot_observed_at":"2026-08-06T19:22:35.279421Z","title":"Explainability for Vision Foundation Models: A Survey","venue":"cs.CV","work_id":"2a023261-6a6d-4431-821e-ca661858e6bf","year":2025},"citing_paper":{"arxiv_id":"2507.05810","last_updated":"2025-07-08T09:30:20Z","snapshot_observed_at":"2026-08-10T21:06:33.414053Z","submitted_at":"2025-07-08T09:30:20Z","title":"Concept-Based Mechanistic Interpretability Using Structured Knowledge Graphs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:22:35.055073Z"},"links":{"cited_paper":"/paper/2501.12203","citing_paper":"/paper/2507.05810"},"observation_digest":"sha256:28d54a69e9267509b1abdf4f2a51a50bc2e328e0440d7a0f0c0777695eebc8d5","observation_id":"016e3ed6-874c-47b5-8b5f-d8d8bdf2198a","resolution":{"observed_at":"2026-08-06T19:22:35.283207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12203/citation-record","integrity":"/paper/2501.12203/integrity","json":"/paper/2501.12203/citation-record.json","paper":"/paper/2501.12203"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.903222Z","title":"LeCun, Y","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.903222Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:ec2e7470770ce43b317981bd0477d9d7966ff2d13c14616ca10e573223e1d539","observation_id":"46a76fd3-68c3-4c5e-9e7c-a87dce9dddb6","resolution":{"observed_at":"2026-08-10T17:26:34.903222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.909395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.909395Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:c186f51c36a30c4bd6ba85aee0ed507be5c9df9ac30848766cd3534fbc019545","observation_id":"d63406fa-aab4-4879-92f9-184da08657ea","resolution":{"observed_at":"2026-08-10T17:26:34.909395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.914088Z","title":"Wortsman, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.914088Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:8c152cfd73b3a79c9bae44d5df3589b26e152657c4b95dc77d86a1d55c9a7160","observation_id":"760e12d3-877c-447e-aa46-6124a4b170dc","resolution":{"observed_at":"2026-08-10T17:26:34.914088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.919120Z","title":"Sauer, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.919120Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:90c5bf7b075b3b2622e155377187a2520b20f0a15be4ab2ba226831d5e78cedc","observation_id":"1ee4df89-838c-4d65-8761-3cdce60f2be7","resolution":{"observed_at":"2026-08-10T17:26:34.919120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.924046Z","title":"Castelvecchi, Can we open the black box of ai?, Nature News 538 (2016) 20","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.924046Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:ea8fa6b2cf06fb006e8097555ee903c8d1c53294a01dc25d1f84980dd2c5bf79","observation_id":"c0293a86-ed96-449f-9a5f-774ff61ff2d8","resolution":{"observed_at":"2026-08-10T17:26:34.924046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.928639Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.928639Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:5d82ec3338f7c4f6247a600f85506d38d4b4023f2e23a35f958750ab5825c2c3","observation_id":"cc7bda3c-ccc8-4213-b5cc-f20c0a4003be","resolution":{"observed_at":"2026-08-10T17:26:34.928639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00184","last_updated":"2018-09-29T10:15:18Z","snapshot_observed_at":"2026-08-10T11:49:06.141530Z","submitted_at":"2018-09-29T10:15:18Z","title":"Stakeholders in Explainable AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00184","snapshot_observed_at":"2026-08-10T17:26:34.934124Z","title":"Preece, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.934124Z"},"links":{"cited_paper":"/paper/1810.00184","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:24097ea4d9d8f16b8aabbc839956c205b97ee3afbf7c6a992e0c4279feacbaa3","observation_id":"787a6a1f-6965-4c6e-bcdf-bf5a095f4fcb","resolution":{"observed_at":"2026-08-10T17:26:34.934124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.938809Z","title":"Rawal, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.938809Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:eef159fcd736c6c37dad6b5727c27b46da9fc89081895e8fade3218d7847b3cb","observation_id":"d7cf1af0-5e93-4fa5-88dd-9d4e96bd64f6","resolution":{"observed_at":"2026-08-10T17:26:34.938809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.942962Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.942962Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:d87d0a5a96361a776c7055a1464ad9d226e1b088f762e6006b82d504a79b724d","observation_id":"1ad17d11-d531-4db2-aa49-5522af251bc3","resolution":{"observed_at":"2026-08-10T17:26:34.942962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.947922Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.947922Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:6b67dace09b8cf2f16b4bf6aae33c7812aa1d9a8dbaeba5e5acc380e17f550ef","observation_id":"2851572f-373e-410c-a0f8-33c77fee7757","resolution":{"observed_at":"2026-08-10T17:26:34.947922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.952939Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.952939Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:3a6432b87ededcd8d647067529b76e3837abed32638ada671ef1a9e2f4e842f4","observation_id":"1ca72ff5-7a2d-4988-a803-3893dd27cb3c","resolution":{"observed_at":"2026-08-10T17:26:34.952939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11561","last_updated":"2024-04-25T21:47:38Z","snapshot_observed_at":"2026-08-11T00:35:05.946128Z","submitted_at":"2021-12-21T22:51:37Z","title":"Explainable Artificial Intelligence for Autonomous Driving: A Comprehensive Overview and Field Guide for Future Research Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11561","snapshot_observed_at":"2026-08-10T17:26:34.957481Z","title":"Atakishiyev, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.957481Z"},"links":{"cited_paper":"/paper/2112.11561","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:8f570ddb87b01f2be42a2bbdb94e9be9f4d28bd886666b7f4ec70dfe5f1549a3","observation_id":"f21a32ea-98cc-4e5b-8b86-4fe1f2f6c4b3","resolution":{"observed_at":"2026-08-10T17:26:34.957481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.962914Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.962914Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:eaeb014d1bd6f98a7e3520822d5d2d8c80c0deaab9faa21a6c589b87a0843f2b","observation_id":"0128b40a-02a5-4da1-a9bc-8db95c0bce87","resolution":{"observed_at":"2026-08-10T17:26:34.962914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.967347Z","title":"Nauta, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.967347Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:8b08c4f5386aa5d9c5e35071267bbc266194f24c148b3cf4399945e0ad697b5a","observation_id":"87d71178-eaea-4d30-8648-939dda8b83fd","resolution":{"observed_at":"2026-08-10T17:26:34.967347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.971674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.971674Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:07c85edae123318eb7850a173cc286d7572bc03e10c221073b73f4057fe2fa57","observation_id":"3f0c512e-7398-40b3-8f62-52347f24f8dd","resolution":{"observed_at":"2026-08-10T17:26:34.971674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.978687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.978687Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:bc9306335aa8e38ff4102777e37c5d5611d05f622a325da3849d8699a35736ed","observation_id":"f0fc3180-7b36-4b10-bb54-654b0362ccd2","resolution":{"observed_at":"2026-08-10T17:26:34.978687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.983963Z","title":"Schneider, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.983963Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b704818be254d187565b063301e80108b7e195bc284620d57036ba5dac81eb46","observation_id":"c31996d1-c0de-43b1-98e7-eaabb427e772","resolution":{"observed_at":"2026-08-10T17:26:34.983963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.988058Z","title":"Brown, B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.988058Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:74d2a1d19047125719816b91dec7a6c2b49b73485b9cc3138c1d0331567c2502","observation_id":"2d8ec2f4-c0d9-4a83-b78c-f00e833e1f46","resolution":{"observed_at":"2026-08-10T17:26:34.988058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:34.992501Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.992501Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:82cf9db4d7fd094210a097ceff2df8303de509abd4c5fed57aee11e42cdc121d","observation_id":"d12d149b-826f-431c-b82f-13b39d839410","resolution":{"observed_at":"2026-08-10T17:26:34.992501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09419","last_updated":"2023-05-01T07:48:05Z","snapshot_observed_at":"2026-08-07T09:28:58.130002Z","submitted_at":"2023-02-18T20:51:09Z","title":"A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09419","snapshot_observed_at":"2026-08-10T17:26:34.997097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:34.997097Z"},"links":{"cited_paper":"/paper/2302.09419","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:177de218c01948250c379552583e3d35c1274eb036585763264d3772a8b9bf1e","observation_id":"769841ca-cab1-4c04-a7dd-d8ca945d679d","resolution":{"observed_at":"2026-08-10T17:26:34.997097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T17:26:35.002379Z","title":"Simonyan, A","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.002379Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:1c276fe047483350a605c52a591a111c7741b00ede363abdd23055f53fe48f82","observation_id":"fdf7cc2c-c601-4b36-accc-9b17e8727958","resolution":{"observed_at":"2026-08-10T17:26:35.002379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.006952Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.006952Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:497c0041021f3c4479681e19c819f4ae7ced7a478790b72931dd555463676fd1","observation_id":"8f10c224-e42b-45ea-848c-66b7917b461a","resolution":{"observed_at":"2026-08-10T17:26:35.006952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T17:26:35.010949Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.010949Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:07715415d10a1fdf54477aa878827e37e2e19ff61566f8c0ef9ad825056286fb","observation_id":"9f313169-d584-41bf-97ee-ad27d3bf89ef","resolution":{"observed_at":"2026-08-10T17:26:35.010949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.015524Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.015524Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:4ee81be6466fec00b0e30e4a3bbeb91552c928bd7f27dcb1bc285162a1dd42ec","observation_id":"9e9ff115-da21-42ce-b928-8011f56b4686","resolution":{"observed_at":"2026-08-10T17:26:35.015524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.020274Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.020274Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:62444edbcdebe37584fda83a94edef8ff716fb78d9994fbde4f0d6cccd907030","observation_id":"0548c984-9199-4ae6-a919-6be5df0f4033","resolution":{"observed_at":"2026-08-10T17:26:35.020274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.024473Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.024473Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b5b9844753df4603565ba868d434d2ed175621506ac39675eec4e155eb7533df","observation_id":"3fa46a93-892f-4034-87e4-3495de5b246e","resolution":{"observed_at":"2026-08-10T17:26:35.024473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.028472Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.028472Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:123ae62aa7cc321704679ab9551f36edadc05c9fe884bae0236eeb6af12bfd7a","observation_id":"3120ef8e-bf74-4606-8bf7-fe3191826ad9","resolution":{"observed_at":"2026-08-10T17:26:35.028472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.032346Z","title":"Radford, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.032346Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:88459a8dbebf93cec31e442e76e8632770dacce69bd111259acae6ae6a425288","observation_id":"d29db030-b8b5-44b4-b0d3-0bd491a98ed1","resolution":{"observed_at":"2026-08-10T17:26:35.032346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T17:26:35.036667Z","title":"Devlin, M.-W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.036667Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:9fb0ad83a3c3e53130bce5a71ae8852f0d2e6686ee31ec7152458a57fc082588","observation_id":"e6a0b460-5ce3-4fb0-a173-ef0faac3047b","resolution":{"observed_at":"2026-08-10T17:26:35.036667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07502","last_updated":"2021-03-15T04:56:31Z","snapshot_observed_at":"2026-08-10T15:39:24.005150Z","submitted_at":"2020-09-16T06:53:15Z","title":"Contextualized Perturbation for Textual Adversarial Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07502","snapshot_observed_at":"2026-08-10T17:26:35.041674Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.041674Z"},"links":{"cited_paper":"/paper/2009.07502","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:8a03b99286557745ca744c97ef305ca18e32b582483fc6b40d5584939e18ad29","observation_id":"2b8e487c-3c2c-46a6-889c-9ce7a0a813f7","resolution":{"observed_at":"2026-08-10T17:26:35.041674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.045938Z","title":"Ravichander, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.045938Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:a52f58f7d57e28e959ebe02441bcb4d6ccf8e013eaa49e84da9cf7c7946643a6","observation_id":"920212cc-b8a0-436d-b63b-017ace97bc0a","resolution":{"observed_at":"2026-08-10T17:26:35.045938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.049987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.049987Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:30b2bbbd8fdfb21834f01004e198c9af0137329d4f9359b005239547698a6479","observation_id":"cf3cb909-dbdf-467b-8743-67ccb3a8f12e","resolution":{"observed_at":"2026-08-10T17:26:35.049987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.053708Z","title":"Rombach, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.053708Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:a0d4604100026bb87861f52401def3ebcb8e0e8384ebe688c284904fde2d94f3","observation_id":"f3a617b3-9de3-486b-bb59-2d2eafc228bb","resolution":{"observed_at":"2026-08-10T17:26:35.053708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.057600Z","title":"Girdhar, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.057600Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:e07ce7d022d4f476c068fc31e64568ec7531841f4f28ce5c370e43d5948f862c","observation_id":"555e3e48-d565-4fe8-b20b-715531536233","resolution":{"observed_at":"2026-08-10T17:26:35.057600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.061295Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.061295Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b21fb83e0e1b4df57fde8cf59b7d2bf6de31dd853f13b0bd8b2bcdd6d95d7426","observation_id":"1fcf16d8-73f4-4ceb-af60-d72cecd0bb96","resolution":{"observed_at":"2026-08-10T17:26:35.061295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T17:26:35.065201Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.065201Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:c63bd0191ffb341bdde2473a72ca8975b1dbf0cf17eece89f8dede519ce54389","observation_id":"07cfb794-61fc-4754-8253-86eb61e4ca34","resolution":{"observed_at":"2026-08-10T17:26:35.065201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.069343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.069343Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b0a23a752831691b1b7f02ca9e0f268441d9234ed37490fb32c5198b0d759d3e","observation_id":"d97b1657-1c4e-4df7-a809-6c889fd55c55","resolution":{"observed_at":"2026-08-10T17:26:35.069343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T17:26:35.073150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.073150Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:392263364eeb8656eece7defcb089463e5852caf81aed0b4f6b995dd9efefd7c","observation_id":"70dabecb-2649-42e5-a86d-aa44bff57721","resolution":{"observed_at":"2026-08-10T17:26:35.073150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:26:35.077265Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.077265Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:1ed7d956338ebcdfd9d8c10c02a436c1e67575a27610b23eeaedafa932b006a2","observation_id":"25f68a8f-1687-438c-97a7-927a3ea4edad","resolution":{"observed_at":"2026-08-10T17:26:35.077265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-10T17:26:35.081419Z","title":"Agrawal, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.081419Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:dd33813eeaf7661a85cdb7443f4da9b2304e00afe943ab2630e2c85286c7c4fe","observation_id":"a589e0b0-381e-4f7f-a32a-e2c920529d15","resolution":{"observed_at":"2026-08-10T17:26:35.081419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T17:26:35.085821Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.085821Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:814a53978fbcbb3fb0b7b3776c7bb7dcd4adb8b8b1738de20d09b3ce7b813583","observation_id":"e19000d3-a64d-479d-b364-1b9e18c8023e","resolution":{"observed_at":"2026-08-10T17:26:35.085821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.089910Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.089910Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:eeb530d22ce4141875f9508d429ad93f19b625a931f055c33ac0b93b38618092","observation_id":"2058707e-af94-432d-aca3-562b18d9737d","resolution":{"observed_at":"2026-08-10T17:26:35.089910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-10T17:26:35.093910Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.093910Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:9203712eed4eaf2edabdff7868bb1ee5b907a624d4873e2f7480f4b2c10c0450","observation_id":"7ad12f30-98b8-4d85-a2f6-85d3ff953da5","resolution":{"observed_at":"2026-08-10T17:26:35.093910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T17:26:35.098046Z","title":"Ramesh, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.098046Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:2322e8fdc1285a82c249ee521c9f5c39f5e70729fed35fe1f2cc60dc7f08eb06","observation_id":"4bf28198-3d49-42af-8d14-801f31707961","resolution":{"observed_at":"2026-08-10T17:26:35.098046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.102701Z","title":"Betker, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.102701Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:d97874cc14b5ecdbaf9f9459392be70985ccfa888bc3be9de788e6fa45f310c8","observation_id":"83aff805-12a7-4d9e-b9a4-e0743b781883","resolution":{"observed_at":"2026-08-10T17:26:35.102701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.106458Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.106458Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b72a0ab967cbf0cb7c52390b97bd8a33404b36ea51850d9da7a5dc33494a29fa","observation_id":"c87f9875-9c01-4905-a7ab-c179fdc7560f","resolution":{"observed_at":"2026-08-10T17:26:35.106458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-10T17:26:35.110455Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.110455Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:1bb504ec5912343c8d48855d8f5d8c5c61a906b03c913418b597d0e2cbaba459","observation_id":"482cf4ef-e6bf-4121-bd7a-2263f6d991ba","resolution":{"observed_at":"2026-08-10T17:26:35.110455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T17:26:35.114520Z","title":"Nichol, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.114520Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:490d71cd469da9c29f0ee4fb008deefabec7326aa9397334ec378651713cce2c","observation_id":"719480d7-51a8-48da-9413-1f8899e16b09","resolution":{"observed_at":"2026-08-10T17:26:35.114520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-10T05:13:08.988270Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-10T17:26:35.118293Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.118293Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:68a6d55146b183b678d9069edc6fdb9c16745936a0a33e1c19ffb5b5a4471752","observation_id":"e4e4b0c0-dab0-4ed2-b30e-cb672a151ecd","resolution":{"observed_at":"2026-08-10T17:26:35.118293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T17:26:35.122142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.122142Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:43ddaaace2e9c9fa76c06c4a994fa5731c0ea47bc4300565caf34d2e06578e4e","observation_id":"bbd38988-0781-4d64-b3c6-4a3aa1875a1d","resolution":{"observed_at":"2026-08-10T17:26:35.122142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-10T17:26:35.126201Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.126201Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:3fbfae0075f711d3402f7524fa9b4cf9a1a19c106a9ca276ba70a77258d5add0","observation_id":"9c639bd1-1bea-4d36-a773-fc828cb791ee","resolution":{"observed_at":"2026-08-10T17:26:35.126201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.130163Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.130163Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:64fbf924073c1b267608cbed5251739656bf2cf8b9ff6c9cfce79cac1ac50183","observation_id":"aa32a758-4344-41df-bc45-03844e3022c7","resolution":{"observed_at":"2026-08-10T17:26:35.130163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T17:26:35.134406Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.134406Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:76b344ecbf0c2114cea22fe3e365901e7a4c18c44c0d555f7d37fbd263299619","observation_id":"c883fd49-9bc7-4e6e-91c4-f2a6eaba401b","resolution":{"observed_at":"2026-08-10T17:26:35.134406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13081","last_updated":"2023-02-08T02:29:27Z","snapshot_observed_at":"2026-08-01T13:34:33.755093Z","submitted_at":"2023-01-30T17:21:30Z","title":"STAIR: Learning Sparse Text and Image Representation in Grounded Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13081","snapshot_observed_at":"2026-08-10T17:26:35.139053Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.139053Z"},"links":{"cited_paper":"/paper/2301.13081","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b1dff0c139bfa6c832bb2a6acbc7a9bafe860cb5a5bd21e9d5bd093d5522f4ac","observation_id":"295232f7-4a71-44e8-8189-1db30573fcef","resolution":{"observed_at":"2026-08-10T17:26:35.139053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-10T17:26:35.143411Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.143411Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b1be4892435ce2b9c51ec5cf0e1b7e5fc3a4410d49dd49bf6d9fadc4cbdb49c6","observation_id":"454df2c3-e13a-4f27-9095-0512a2a9d126","resolution":{"observed_at":"2026-08-10T17:26:35.143411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.147315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.147315Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:514e2af3158b3d3d91745127fad41fda69067bc2414b6e4b5fc3ddb455f026b7","observation_id":"7230cb2c-1b2a-4140-aca0-8982a301648c","resolution":{"observed_at":"2026-08-10T17:26:35.147315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.151066Z","title":"Poeta, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.151066Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:62fc66ac4445e4806c44409fa0a64f6ce051a2279f12ca0879f6ff197a2253a4","observation_id":"3b4cb5ca-cbb4-4440-8e06-857e28f1afc1","resolution":{"observed_at":"2026-08-10T17:26:35.151066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.154633Z","title":"Galton, Regression towards mediocrity in hereditary stature., The Journal of the Anthropological Institute of Great Britain and Ireland 15 (1886) 246–263","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.154633Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:70f5139d192d61835712ecc37db783551dbfcc621243eb5e68edeeff69fbd403","observation_id":"2bc1fcb8-2024-4609-be15-f4ec89d4ffd5","resolution":{"observed_at":"2026-08-10T17:26:35.154633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.158578Z","title":"McCullagh, Generalized Linear Models, Routledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.158578Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:f7afb2a244596a92e3e086f8f1296aba594dfcb1e62863b676d953d0893eabcc","observation_id":"5edbb53f-28cf-47fc-a8ec-eff13b6562cc","resolution":{"observed_at":"2026-08-10T17:26:35.158578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.162114Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.162114Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:9f67714c90563f275d9fbcc20d25895b43fa694eea20a1e2602e042b6cd27d0b","observation_id":"5deb0687-4235-4899-bd69-ffbcb2267cee","resolution":{"observed_at":"2026-08-10T17:26:35.162114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.166335Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.166335Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:c1f1ee0fd1bbd6d19d8e10e50040f738a3efd8e4863cfcc04337256511b78378","observation_id":"d4cf70c5-1ba7-4be5-bff1-1232558f29bb","resolution":{"observed_at":"2026-08-10T17:26:35.166335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.170075Z","title":"Why should I trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.170075Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:6117690a60b8c9e38ca206cff97c908503e5548b2ff77c16a975ec7c179c7812","observation_id":"6383f8e9-b9db-4af5-b067-ecf638dd76d8","resolution":{"observed_at":"2026-08-10T17:26:35.170075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.173922Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.173922Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:bf6351765ddc39e1e9f62907fade2263a2c6f2228394c7d5ba6f40c51d277489","observation_id":"32c59e4a-4257-4775-9e09-6f38ac6ea1bf","resolution":{"observed_at":"2026-08-10T17:26:35.173922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-08-10T19:32:03.798711Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-10T17:26:35.177756Z","title":"Petsiuk, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.177756Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:c11dbc7624fb46ff5ca2a3c81f204912d10f2aa62208bc371f75326f78c6b728","observation_id":"390b381d-66e5-411f-8ad2-f1e210b9b046","resolution":{"observed_at":"2026-08-10T17:26:35.177756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.182281Z","title":"Cortez, M","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.182281Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:55026f0fd592008a912bd85f0784d184c1e0683965fed3326f146dc0657b8008","observation_id":"b512ad95-a53d-4a75-9cb8-2eee47b4e98e","resolution":{"observed_at":"2026-08-10T17:26:35.182281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.186645Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.186645Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:5977e67815c0fd830031c23da466dd47c4a31022c19f3e2593431d4a5a76c849","observation_id":"9f5f01e0-9cb3-43fc-b6c5-e211dbe3883f","resolution":{"observed_at":"2026-08-10T17:26:35.186645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13445","last_updated":"2023-01-31T06:49:42Z","snapshot_observed_at":"2026-07-06T14:46:26.697969Z","submitted_at":"2023-01-31T06:49:42Z","title":"A Survey of Explainable AI in Deep Visual Modeling: Methods and Metrics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13445","snapshot_observed_at":"2026-08-10T17:26:35.190633Z","title":"Akhtar, A survey of explainable ai in deep visual modeling: Methods and metrics, arXiv preprint arXiv:2301.13445 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.190633Z"},"links":{"cited_paper":"/paper/2301.13445","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:a11b981206627526b20e9d1f1c5b12ffe81b42b352898581a685081d84488e95","observation_id":"91dfb81e-e5cc-484d-8566-7dee6563f5d7","resolution":{"observed_at":"2026-08-10T17:26:35.190633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.195066Z","title":"Chatzimparmpas, R","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.195066Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:3ef69d7b64180c8750a11cb7a0187a50b4be13b9e806d3496a74f858a63b9739","observation_id":"44bea955-7108-44cb-858d-c0fed13cae44","resolution":{"observed_at":"2026-08-10T17:26:35.195066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.199472Z","title":"Saeed, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.199472Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b5e25141078a685400c80b5ba907baae7ad68506fea5518581525edac511aa50","observation_id":"daa70789-b4b7-4cd1-9577-833bb4c3a9cf","resolution":{"observed_at":"2026-08-10T17:26:35.199472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.203432Z","title":"Joshi, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.203432Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:e71174dfbcd553a87b73be092b209daa594ef25f929de3bd058ab33dae5087b0","observation_id":"705f3d6f-1367-47ba-bdb9-c63dc63757f9","resolution":{"observed_at":"2026-08-10T17:26:35.203432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.207628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.207628Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:5881b76b4e384b70937d2d53a28a9ff5339c73e06fe7f018c9cdae86fc618599","observation_id":"83443531-c551-4b1d-981e-2b9b2d5b5e35","resolution":{"observed_at":"2026-08-10T17:26:35.207628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.212127Z","title":"Fumanal-Idocin, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.212127Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:1dff63f6f19014db1195e8e9bbbe9176dd62b68d538499d268a0c211f90a9bef","observation_id":"dc4a66e8-6bb6-4e74-b8fb-f7e06c8caeb4","resolution":{"observed_at":"2026-08-10T17:26:35.212127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.216496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.216496Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:4ed983fc2d7cb7cf984b1872ca51f6e3f7abd29673aa0791bb65bc9abbc47e72","observation_id":"db1be952-ae85-4a22-a6a6-4c094771dbc4","resolution":{"observed_at":"2026-08-10T17:26:35.216496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13577","last_updated":"2024-02-21T07:16:29Z","snapshot_observed_at":"2026-08-04T20:15:48.785165Z","submitted_at":"2024-02-21T07:16:29Z","title":"BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13577","snapshot_observed_at":"2026-08-10T17:26:35.221054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.221054Z"},"links":{"cited_paper":"/paper/2402.13577","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:7da016b565c0ec8ca6838c5bb8074432e8abbd25a6df1a805d4300cb90af62e5","observation_id":"b4afb7d4-7d55-4602-b98b-f60926213888","resolution":{"observed_at":"2026-08-10T17:26:35.221054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.226035Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.226035Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:4ce89d84a0e88613c6a499276787ff2477575da7982bcf9fda9131f4138564df","observation_id":"d02218ba-3ea5-422b-bddb-452759153a36","resolution":{"observed_at":"2026-08-10T17:26:35.226035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08919","last_updated":"2024-02-14T03:31:17Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:31:17Z","title":"Interpretable Measures of Conceptual Similarity by Complexity-Constrained Descriptive Auto-Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08919","snapshot_observed_at":"2026-08-10T17:26:35.230069Z","title":"Achille, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.230069Z"},"links":{"cited_paper":"/paper/2402.08919","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b765155471cdc77aef48ed648d0f67fa8d033e81a196bb660e5a23bc49576dfa","observation_id":"8486b9cf-c9de-4b4b-870e-e1ab10a57773","resolution":{"observed_at":"2026-08-10T17:26:35.230069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10747","last_updated":"2023-12-17T15:37:41Z","snapshot_observed_at":"2026-07-06T17:04:17.738921Z","submitted_at":"2023-12-17T15:37:41Z","title":"CEIR: Concept-based Explainable Image Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10747","snapshot_observed_at":"2026-08-10T17:26:35.234514Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.234514Z"},"links":{"cited_paper":"/paper/2312.10747","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:cd6c14c8f42c5f3c2770174d5c0b7e80c9798d531c07077fb6a63d8b06f56e6a","observation_id":"c4983aa1-06fe-4094-b52a-c24ec1b3179d","resolution":{"observed_at":"2026-08-10T17:26:35.234514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01981","last_updated":"2023-07-05T01:45:19Z","snapshot_observed_at":"2026-08-10T13:36:29.094331Z","submitted_at":"2023-07-05T01:45:19Z","title":"A ChatGPT Aided Explainable Framework for Zero-Shot Medical Image Diagnosis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01981","snapshot_observed_at":"2026-08-10T17:26:35.238540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.238540Z"},"links":{"cited_paper":"/paper/2307.01981","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:93d735b7a7b9eb2bbe5361faddc488959cdb9fc5dc812d01e23b3aa39c22412e","observation_id":"3ec2d2ba-34f3-4b3f-b466-7b35a7821735","resolution":{"observed_at":"2026-08-10T17:26:35.238540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.242622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.242622Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:345bd00fd8abce98094d679e85efd7594ca6a99293d83a15ee4d5a50f987bae3","observation_id":"cf3693bd-d310-4d0c-8bc4-be7a704293f9","resolution":{"observed_at":"2026-08-10T17:26:35.242622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11236","last_updated":"2024-04-25T03:04:14Z","snapshot_observed_at":"2026-08-10T04:59:11.004346Z","submitted_at":"2024-03-17T14:49:09Z","title":"ChartThinker: A Contextual Chain-of-Thought Approach to Optimized Chart Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11236","snapshot_observed_at":"2026-08-10T17:26:35.246209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.246209Z"},"links":{"cited_paper":"/paper/2403.11236","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:ccd03dd37887328e23710265152ec23c4d7b694c7be5f02c92ca748879793a51","observation_id":"e2f55cd9-a2bd-44a8-951b-106a88d9ef31","resolution":{"observed_at":"2026-08-10T17:26:35.246209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.250132Z","title":"Menon, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.250132Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:eb8f2d20d4812996e715cd300b8b60c2444c9bbc1aad0d17ec2e30c08caeff02","observation_id":"3eb7d7e3-f695-4597-8c35-e5c3d09f0dd4","resolution":{"observed_at":"2026-08-10T17:26:35.250132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.254195Z","title":"Kazmierczak, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.254195Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:198599f23125b700a7e8b9377d52d4e986f636937d17432486269d0ff0e02eda","observation_id":"561563b2-c3d9-4d07-9d87-8bb4e3d4a333","resolution":{"observed_at":"2026-08-10T17:26:35.254195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.258183Z","title":"Zhang, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.258183Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:5262156ec7f5d5b5754b1a4a95f67bbc7160a2f6e06a9f1e9728a96b062b5978","observation_id":"896c6ce8-1c20-4fd9-944b-f689fac4e894","resolution":{"observed_at":"2026-08-10T17:26:35.258183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.262278Z","title":"Mannix, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.262278Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:6cf41fdaa5ebd5b11c6e81b5d6b73ecf1232abf65e0719f4b7ee4c67fac583d4","observation_id":"6a896251-b22a-42f0-8219-c85acc8b221d","resolution":{"observed_at":"2026-08-10T17:26:35.262278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07919","last_updated":"2023-06-17T06:40:27Z","snapshot_observed_at":"2026-08-08T01:58:48.156445Z","submitted_at":"2023-04-16T23:59:25Z","title":"Chain of Thought Prompt Tuning in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07919","snapshot_observed_at":"2026-08-10T17:26:35.266818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.266818Z"},"links":{"cited_paper":"/paper/2304.07919","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:2f9518482599dac58ad51e1481d49862b1ab2889c12078110116bd6193e11588","observation_id":"67fc934f-0aae-4a4f-8576-fff36db3ef09","resolution":{"observed_at":"2026-08-10T17:26:35.266818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16187","last_updated":"2023-06-21T01:27:37Z","snapshot_observed_at":"2026-08-10T16:49:51.470084Z","submitted_at":"2023-03-28T17:53:06Z","title":"Visual Chain-of-Thought Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16187","snapshot_observed_at":"2026-08-10T17:26:35.271280Z","title":"Harvey, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.271280Z"},"links":{"cited_paper":"/paper/2303.16187","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:bcb0307a4bad52db75d6aceaf1c5aa3133d92dece0e41c7cabff45fa9877870c","observation_id":"a3bcf6c7-b2df-46ac-83b2-5e894646abd9","resolution":{"observed_at":"2026-08-10T17:26:35.271280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04461","last_updated":"2024-03-19T21:48:59Z","snapshot_observed_at":"2026-07-06T16:16:14.768472Z","submitted_at":"2023-09-08T17:49:44Z","title":"Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04461","snapshot_observed_at":"2026-08-10T17:26:35.275311Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.275311Z"},"links":{"cited_paper":"/paper/2309.04461","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:f68aec40d6baa386c7192c85585391e6cbe8bf2605b4d174a55e8031a89a50e0","observation_id":"b749aef6-e960-46a8-bf24-d94775189842","resolution":{"observed_at":"2026-08-10T17:26:35.275311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.279998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.279998Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:a51bb0e5ed8612e25ac4e962a16b74f6157335379a120960499f98669933e220","observation_id":"218f416b-964d-4515-b656-1b062d0b76dc","resolution":{"observed_at":"2026-08-10T17:26:35.279998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.290447Z","title":"Zheng, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.290447Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:0cde226b69d8fbfaed8f3291f170bb2e54e4d1e032de506d2d7f2b7a65c26daa","observation_id":"851d70a2-fa92-4509-8074-094b9d1b4390","resolution":{"observed_at":"2026-08-10T17:26:35.290447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14920","last_updated":"2024-03-06T11:03:01Z","snapshot_observed_at":"2026-07-06T16:52:11.338048Z","submitted_at":"2023-11-25T03:52:03Z","title":"DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14920","snapshot_observed_at":"2026-08-10T17:26:35.294786Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.294786Z"},"links":{"cited_paper":"/paper/2311.14920","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:a158fcd2b3cf5cab5a1ab479646224b82f7332b2fea68e4e9f725803c64fb0ce","observation_id":"756597f3-94ec-4b0f-b1a6-63ad4bf507b9","resolution":{"observed_at":"2026-08-10T17:26:35.294786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03641","last_updated":"2024-01-08T03:06:02Z","snapshot_observed_at":"2026-08-10T16:53:31.909115Z","submitted_at":"2024-01-08T03:06:02Z","title":"DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03641","snapshot_observed_at":"2026-08-10T17:26:35.300656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.300656Z"},"links":{"cited_paper":"/paper/2401.03641","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:fe34708e45bdcb4a09e39e6be099a854e13b7332a72810cc0449985413857b6e","observation_id":"07006743-8521-4dce-ac6e-454c6ca94d2d","resolution":{"observed_at":"2026-08-10T17:26:35.300656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19405","last_updated":"2024-03-03T09:19:44Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:03:23Z","title":"Navigating Hallucinations for Reasoning of Unintentional Activities","version":2},"cited_work":{"arxiv_id":"2402.19405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19405","snapshot_observed_at":"2026-08-10T17:26:37.789876Z","title":"Navigating Hallucinations for Reasoning of Unintentional Activities","venue":"cs.CV","work_id":"aebe2647-6c4c-4e34-9a1b-c3da9826e58a","year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.305725Z"},"links":{"cited_paper":"/paper/2402.19405","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:1719c9544d0ce4466adc56ef23b83492b03a5588510bdbb719b2eb28098d6853","observation_id":"62b868df-f555-45a3-b895-b314e31d031e","resolution":{"observed_at":"2026-08-10T17:26:37.795294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00438","last_updated":"2023-12-01T09:10:33Z","snapshot_observed_at":"2026-08-10T14:43:54.873284Z","submitted_at":"2023-12-01T09:10:33Z","title":"Dolphins: Multimodal Language Model for Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00438","snapshot_observed_at":"2026-08-10T17:26:35.310664Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.310664Z"},"links":{"cited_paper":"/paper/2312.00438","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:36d510509548dd3d9734bcb46440c0be640b033fafe1668bf4feb02b0015f7eb","observation_id":"68bb0ec4-245a-4f04-8f36-e3f0ec66f53d","resolution":{"observed_at":"2026-08-10T17:26:35.310664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-09T15:49:58.636852Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-10T17:26:35.315329Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.315329Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:21147fb30c74defc8b65d0e5b795119fe5519dbfc99604f7d5c112762a4450ef","observation_id":"997f4aee-a7be-4335-938d-f5033ac03528","resolution":{"observed_at":"2026-08-10T17:26:35.315329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09742","last_updated":"2024-01-30T22:49:18Z","snapshot_observed_at":"2026-07-06T17:17:11.535092Z","submitted_at":"2024-01-18T05:50:09Z","title":"Image Translation as Diffusion Visual Programmers","version":2},"cited_work":{"arxiv_id":"2401.09742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09742","snapshot_observed_at":"2026-08-10T17:26:37.744302Z","title":"Image Translation as Diffusion Visual Programmers","venue":"cs.CV","work_id":"f2133e1a-bb5f-4d75-b160-f6ad0832ae90","year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.320253Z"},"links":{"cited_paper":"/paper/2401.09742","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:730299951287623e2cb9430176fefc96c3043028707f7fb1ce7543b8de7a9046","observation_id":"101631e3-0413-4f93-aa71-b3eb0cea730d","resolution":{"observed_at":"2026-08-10T17:26:37.748931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.324493Z","title":"Zhang, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.324493Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:ae32d11d8ad8d75706ea5ecc8ee990a8a5ed6f264ad100e13ec33b26e0e13be6","observation_id":"631fe275-96d0-4ce8-9892-b5dd8961c0b0","resolution":{"observed_at":"2026-08-10T17:26:35.324493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05612","last_updated":"2023-04-07T00:57:16Z","snapshot_observed_at":"2026-08-01T23:17:00.867406Z","submitted_at":"2022-12-11T21:52:21Z","title":"Multimodal and Explainable Internet Meme Classification","version":3},"cited_work":{"arxiv_id":"2212.05612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.05612","snapshot_observed_at":"2026-08-10T17:26:37.727101Z","title":"Multimodal and Explainable Internet Meme Classification","venue":"cs.AI","work_id":"3f990e6b-c1e7-456f-9494-837171d35b56","year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.328474Z"},"links":{"cited_paper":"/paper/2212.05612","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:b4be20176081f24affe9d9bdc156548f77513ef19eb7fff9a61dbc21aae407eb","observation_id":"e19e70fa-14b6-4350-a152-75f3fe342b62","resolution":{"observed_at":"2026-08-10T17:26:37.731626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10005","last_updated":"2024-07-18T02:35:30Z","snapshot_observed_at":"2026-07-06T17:17:23.567885Z","submitted_at":"2024-01-18T14:21:56Z","title":"Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation","version":2},"cited_work":{"arxiv_id":"2401.10005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.10005","snapshot_observed_at":"2026-08-10T17:26:37.708657Z","title":"Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation","venue":"cs.CV","work_id":"1ac47bb8-4457-4e63-9575-fd9db0cf447f","year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.332816Z"},"links":{"cited_paper":"/paper/2401.10005","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:059dcd516bf233fc7ac16b5968a532e4d65383811ffd058b8a1f7e8ec63a84f8","observation_id":"d98aaf30-6ffc-4bde-9035-18895bfd2bcf","resolution":{"observed_at":"2026-08-10T17:26:37.713888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03701","last_updated":"2024-01-08T07:13:26Z","snapshot_observed_at":"2026-08-10T09:56:12.400340Z","submitted_at":"2024-01-08T07:13:26Z","title":"ExTraCT -- Explainable Trajectory Corrections from language inputs using Textual description of features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03701","snapshot_observed_at":"2026-08-10T17:26:35.337370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.337370Z"},"links":{"cited_paper":"/paper/2401.03701","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:47c8a5bb55e08cf65f411e5d38dc7c62079954986ae79ddf1c53978c071328d2","observation_id":"b2ec6400-d0d2-4e4b-8063-0167203945b4","resolution":{"observed_at":"2026-08-10T17:26:35.337370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:26:35.341966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.341966Z"},"links":{"citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:0bb9ab6d4d91c509b2162ca42c37a8efdffdc0fcf45314129615a4c880b5c426","observation_id":"cff610bb-6617-4b46-a85a-e16ea0223e5f","resolution":{"observed_at":"2026-08-10T17:26:35.341966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:06:16.114103Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":270},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 270 outbound references and 1 inbound Pith citation observation for arXiv:2501.12203."}