{"as_of":"2026-08-16T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c94254258cd30252db12c8f02f1ce132832cf3faa4fdb8170af6656d22f67ac","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:07:35.352999Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07802/citation-record","integrity":"/paper/2412.07802/integrity","json":"/paper/2412.07802/citation-record.json","paper":"/paper/2412.07802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.925869Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.925869Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:3845799bffa89268a14c4d5280c72dc1780589b521d0c6d017ea41fd7979d5f1","observation_id":"d287122b-39f3-4d6e-a10b-b317f101a046","resolution":{"observed_at":"2026-08-11T20:07:34.925869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.931225Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.931225Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:901db682e83436f96a41edbb2977a80b24a512633aaf7fde4b7731f855af6ff3","observation_id":"39d05a9e-8ba5-4f39-b5cf-b779a25fefd2","resolution":{"observed_at":"2026-08-11T20:07:34.931225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.936341Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.936341Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:9c89e702cb0a48ed3fdb3a9588b3cf5b948ad419a63994f97e0a0099505c5387","observation_id":"95726ec4-976d-423a-9fb5-70ad5a1eba6d","resolution":{"observed_at":"2026-08-11T20:07:34.936341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.01705","last_updated":"2016-06-07T23:25:51Z","snapshot_observed_at":"2026-08-15T09:57:07.250612Z","submitted_at":"2016-01-07T21:21:59Z","title":"Learning to Compose Neural Networks for Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.01705","snapshot_observed_at":"2026-08-11T20:07:34.940858Z","title":"Learning to compose neural networks for question answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.940858Z"},"links":{"cited_paper":"/paper/1601.01705","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:b3cc833d6a116c1ddebfa0f3f1fb310fa2b6a212ed5ecd9f32dce2686cd23b04","observation_id":"3cfbc6dc-c9dd-4010-8d77-2815001a1e52","resolution":{"observed_at":"2026-08-11T20:07:34.940858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.945558Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.945558Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:72e03fedd2af5c611fda81de537659722e6229934935c48021ffc0884315318b","observation_id":"8799e7bb-ec1d-4fee-b375-ed5f7e4fdd54","resolution":{"observed_at":"2026-08-11T20:07:34.945558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.950222Z","title":"A survey on tree edit distance and related problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.950222Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:9222886301b382bcd00a987ffe8c1c09e7bc0eedb71a60f2447b0d91ab21b1d9","observation_id":"8b3f5dae-c2c0-492c-b403-16a6aae8ca91","resolution":{"observed_at":"2026-08-11T20:07:34.950222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.954578Z","title":"e-snli: Natural language inference with natural language explanations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.954578Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6abd35b90523b5c72f1af8b881dc6b2a8ff0309e0cb2413f281bc00db061091f","observation_id":"b455b4df-91ec-465a-b011-28148c6c7fc6","resolution":{"observed_at":"2026-08-11T20:07:34.954578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.958764Z","title":"Unsuper- vised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.958764Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4995813b14b3a9aee059dfd306d0b23fa251e183956968028ab571476dec80ef","observation_id":"96fda153-dd83-4efd-9e5d-1afc153ea96a","resolution":{"observed_at":"2026-08-11T20:07:34.958764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.962716Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.962716Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:cbbbf1e4e47c942e10dac0fe70b7131c4c1944a1773b4d21e5d8548ee9b68b6a","observation_id":"7911599c-7388-42df-82a7-220beac16e7d","resolution":{"observed_at":"2026-08-11T20:07:34.962716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.966775Z","title":"This looks like that: deep learning for interpretable image recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.966775Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:fb80d270594e6d6b8c4ced297148b1d2d7448303921fe163418c1e1e9a460d8e","observation_id":"5eb792cf-97ab-4db0-8586-2e91e8859ada","resolution":{"observed_at":"2026-08-11T20:07:34.966775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.971195Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.971195Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:d73c7ea79dddf57af6f739f875fab3075b010e26226802e1515eb4a78fb50d5e","observation_id":"59f2b850-1e45-405a-97e8-4fb377fd551a","resolution":{"observed_at":"2026-08-11T20:07:34.971195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-11T20:07:34.975450Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.975450Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a7196181401cc3991e77a197bf56022bb6dfbfea7ba2d0c29574e014acc2df18","observation_id":"55f551ae-40ae-4e7a-815a-05f229841883","resolution":{"observed_at":"2026-08-11T20:07:34.975450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02057","last_updated":"2021-08-16T17:40:21Z","snapshot_observed_at":"2026-08-14T13:37:25.911808Z","submitted_at":"2021-04-05T17:59:40Z","title":"An Empirical Study of Training Self-Supervised Vision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02057","snapshot_observed_at":"2026-08-11T20:07:34.980032Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.980032Z"},"links":{"cited_paper":"/paper/2104.02057","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:94f1b5421c7d8f71ab745e9882c5aad1e7c55d2ab87ba60e61f004dc3ab9434d","observation_id":"15fc1976-a297-4000-94ef-8463dbc12913","resolution":{"observed_at":"2026-08-11T20:07:34.980032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.986040Z","title":"Self-born wiring for neural trees","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.986040Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:41e524c41a3dfccfde297f4d126cff9a9c8459b623c8c5dc79b593490a8deacc","observation_id":"b6b286e1-989a-46ef-915f-63137bbc7115","resolution":{"observed_at":"2026-08-11T20:07:34.986040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.990229Z","title":"Whatever next? predictive brains, situated agents, and the future of cognitive science","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.990229Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:f4c50330927d6b744b3c4e183c9558c69ea0914b0128846a035f4fd47979acc4","observation_id":"a701826f-1b2c-4863-ab54-7c1ac9c81648","resolution":{"observed_at":"2026-08-11T20:07:34.990229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:34.995362Z","title":"Nearest neighbor pattern classification","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:34.995362Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:7c202e6211e42b26ccaddaeacb54f803b1afdeaa80095c9dba16ca1fa5a37502","observation_id":"94f491c4-af0e-42f5-b9c0-fab256aa3d4d","resolution":{"observed_at":"2026-08-11T20:07:34.995362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.000185Z","title":"Extracting tree-structured representations of trained networks","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.000185Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:692657495096a461b55a687167f742a91510fe32fa00e85a7e5504b534adbfe2","observation_id":"d19211e6-aed5-496c-8bdc-3b39e9bff659","resolution":{"observed_at":"2026-08-11T20:07:35.000185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04552","last_updated":"2017-11-29T14:51:40Z","snapshot_observed_at":"2026-08-13T11:54:46.030796Z","submitted_at":"2017-08-15T15:21:53Z","title":"Improved Regularization of Convolutional Neural Networks with Cutout","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04552","snapshot_observed_at":"2026-08-11T20:07:35.006591Z","title":"Improved regularization of convolutional neural networks with cutout","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.006591Z"},"links":{"cited_paper":"/paper/1708.04552","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:76613e3ed3a9a311748f316fc02c075d7f0257c7195d57c1cb8a213c12c93e41","observation_id":"254d7648-fe50-4343-8479-08f52bbff4b8","resolution":{"observed_at":"2026-08-11T20:07:35.006591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T20:07:35.011609Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.011609Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:5dc3799a69e2b2c1bedfc8732de7a95355d65ed22609404815e867a160a3a268","observation_id":"e55fb3a2-fa2a-43a9-92c0-f58f3b33f9ce","resolution":{"observed_at":"2026-08-11T20:07:35.011609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.016296Z","title":"wordnet: WordNet Interface, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.016296Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a7e021f41610fc190f0dd7498b31671eff64c1b41f9cc1d25f46eb3d8a5ef341","observation_id":"d183024a-fbb9-4b87-bc80-c8d6712adc51","resolution":{"observed_at":"2026-08-11T20:07:35.016296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09784","last_updated":"2017-11-27T15:50:50Z","snapshot_observed_at":"2026-08-15T17:22:57.726836Z","submitted_at":"2017-11-27T15:50:50Z","title":"Distilling a Neural Network Into a Soft Decision Tree","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09784","snapshot_observed_at":"2026-08-11T20:07:35.020566Z","title":"Distilling a neural network into a soft decision tree","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.020566Z"},"links":{"cited_paper":"/paper/1711.09784","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:7b04439735302f8a14b9ce6f2054cb51de20dcb8262471c76aab388829aa0c51","observation_id":"012822fd-03b4-4dd3-a51a-23ead1a45097","resolution":{"observed_at":"2026-08-11T20:07:35.020566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.025164Z","title":"Interpreting CLIP’s image representation via text-based decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.025164Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a19a68ecfef4f7ce24fe23b2c7ec59e8e3f0dcef2bc167d0eaaa3a1f9534b2a7","observation_id":"b454b4d0-4f0d-4ba8-a340-5607468f3aa5","resolution":{"observed_at":"2026-08-11T20:07:35.025164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.029197Z","title":"Wichmann, and Wieland Brendel","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.029197Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:724a631c090a4d0d3e8111018127699aae15a2c1e20cb4ea67691559f9cd4553","observation_id":"38a8b640-f69e-416d-bd00-8b8fbc7202c3","resolution":{"observed_at":"2026-08-11T20:07:35.029197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.033374Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.033374Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:0501a7e37dd8f9ce0004e796ff511d9fbc41564d2b5938713c96554a76b636bb","observation_id":"c05fffe8-217d-4bb1-ae20-a7539849dfd8","resolution":{"observed_at":"2026-08-11T20:07:35.033374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11559","last_updated":"2022-11-18T18:50:09Z","snapshot_observed_at":"2026-08-13T13:39:28.410226Z","submitted_at":"2022-11-18T18:50:09Z","title":"Visual Programming: Compositional visual reasoning without training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11559","snapshot_observed_at":"2026-08-11T20:07:35.037174Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.037174Z"},"links":{"cited_paper":"/paper/2211.11559","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:cdd5a9f75c0beb744c357cc3ae5dab344ac40d59970e0b2be81708d18fae040f","observation_id":"a467ee9f-2e36-41dd-b523-95bcc042a8fd","resolution":{"observed_at":"2026-08-11T20:07:35.037174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.041402Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.041402Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:8150a082732666adf25f78879a9757996b256062c224f1bdfefae44ef781c8c1","observation_id":"34d9927d-d889-4699-ab40-68a0690e5450","resolution":{"observed_at":"2026-08-11T20:07:35.041402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.046241Z","title":"Generating visual explanations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.046241Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:3b5b99474f50892504a77ed74529946a269650ed427d541d18c47450b9a7b172","observation_id":"1ec714f3-b8f4-4f4d-9a5f-2fc5a24b5949","resolution":{"observed_at":"2026-08-11T20:07:35.046241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.050287Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.050287Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:1d748a357e6ba248aeb0d895b40449f717ec46b2c497ae0c8eced327835587db","observation_id":"d4bd6ceb-9a4a-4779-be0e-2d603b189fa2","resolution":{"observed_at":"2026-08-11T20:07:35.050287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.054375Z","title":"Densely connected convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.054375Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:9f7c5370f855287a0b420705acb01f29ba0aae036acde75c356f8394a2b5dd2d","observation_id":"2dc95556-449f-4d10-b2bc-77c303b2b2a1","resolution":{"observed_at":"2026-08-11T20:07:35.054375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.058513Z","title":"Prototype optimization for nearest-neighbor classification","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.058513Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:b2126a5763ea414155cd2e63e7b67fae7682e3df7c2dcd89038652b2cb9261ea","observation_id":"7ccf9fff-0da3-489c-a83d-de2b9d98a65b","resolution":{"observed_at":"2026-08-11T20:07:35.058513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.062327Z","title":"Discovering states and transformations in image collections","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.062327Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:c5ea62161aed366bdc490e440e8ee16c8093ee71ea3cb4bc936f458c9e54bcbf","observation_id":"d21f87c6-4756-40f4-90ea-1d51f7de122b","resolution":{"observed_at":"2026-08-11T20:07:35.062327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.066381Z","title":"Hierarchical mixtures of experts and the em algorithm","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.066381Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4262590424ede42be929f0c2c357819bfc8fe4a778c9b1b96fd099348b2210bf","observation_id":"3ded331e-ef42-4fac-86a6-d99907bf4846","resolution":{"observed_at":"2026-08-11T20:07:35.066381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.422884Z","title":"On the approximability of the maximum common subgraph problem","venue":null,"work_id":"94a11553-c9f5-4c55-8034-06fdf71fe5b2","year":1992},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.070899Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:8fa2a8f872f1cdb061a52d0c4b36256199c81e248932c74fd6d5f475b49ca9fa","observation_id":"765281fe-6245-4c87-9969-b1c189fdd3bc","resolution":{"observed_at":"2026-08-11T20:07:36.427322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.398593Z","title":"Proto2proto: Can you recognize the car, the way i do? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10233–10243, 2022","venue":null,"work_id":"f2510ce9-a1cc-4b19-b646-c0c0666407cc","year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.074800Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6eddf0827cb18bdcc91a9558c0cf77d60742302a3337dcffc8a9756c95ddadc7","observation_id":"e1cc92bf-e41a-4799-bc28-a39dd6ba99bb","resolution":{"observed_at":"2026-08-11T20:07:36.413594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.384928Z","title":"Textual explanations for self-driving vehicles","venue":null,"work_id":"45f546ab-be1b-415e-8495-f78e6d02d9a8","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.079015Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4aa4d38cc6af923b2206c189e65e85b19a2ee60c27f65cfcb505649fae8843ed","observation_id":"a9717e46-6a52-4db7-95df-01a4b0de8f11","resolution":{"observed_at":"2026-08-11T20:07:36.389746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T20:07:35.082734Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.082734Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:7b6c1552e54940c495e4aaa9c6b70b391c410ab23119b5595b5420570bd0f32e","observation_id":"3990665d-1a60-4a5d-a354-77c68c343551","resolution":{"observed_at":"2026-08-11T20:07:35.082734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.372145Z","title":"Learning vector quantization","venue":null,"work_id":"46406937-6856-498c-b786-b997f85e34bd","year":1995},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.087143Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:94fedad239457820a4b475d0126ab6db4a97fd1f910ff3d70923d68bc8b32e96","observation_id":"3ea3b2fc-549e-4109-a1b8-0b5f0728473c","resolution":{"observed_at":"2026-08-11T20:07:36.376657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.359110Z","title":"Deep neural decision forests","venue":null,"work_id":"09a2f276-bbc8-466c-834a-abdc524e0efc","year":2015},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.091504Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:f4e4e86bceb4b8e183556618eb9eb4e8d4ee23640a3b6d523f73c497f608d1f8","observation_id":"456c27d8-7660-46a8-b40b-dee51f2cf49e","resolution":{"observed_at":"2026-08-11T20:07:36.363106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.095714Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.095714Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:f04a8f412111adaf14effc864889ad4d17c2f2ed3d0967df0980daf97002eb90","observation_id":"dc620ac5-fbfc-4293-9d18-ca252cb039fb","resolution":{"observed_at":"2026-08-11T20:07:35.095714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.339034Z","title":"Deep learning for case-based reasoning through prototypes: A neural network that explains its predictions","venue":null,"work_id":"49c67c56-5b84-4a00-aa88-2c0e0fb45ac8","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.099668Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a41d8cdf07f9daded140ac1adea7671b245c710acc95d77bfe69b37f54954fb1","observation_id":"24a6a57f-607b-423b-84e4-5c516f71967d","resolution":{"observed_at":"2026-08-11T20:07:36.343178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.325767Z","title":"Vqa-e: Explaining, elaborating, and enhancing your answers for visual questions","venue":null,"work_id":"362d007f-33f9-40ce-bc6e-a2aed1a2c06d","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.103730Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:5dc485d4d29578c01c0789576c7395c5607d7a0c04c37fd74e268ef54826ae1b","observation_id":"1613ff92-fa76-4d97-8d20-87ad7328ddc3","resolution":{"observed_at":"2026-08-11T20:07:36.330172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.312059Z","title":"A systematic investigation of commonsense knowledge in large language models","venue":null,"work_id":"0e9069d9-de8d-445f-b03b-4257cba61499","year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.107630Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:e0c6f72c570bac1f50ef1723ea76141b74df8b9259592ae8c5e092647a972643","observation_id":"482986b5-fc79-47aa-9a3b-f5ea1886c9ef","resolution":{"observed_at":"2026-08-11T20:07:36.316551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16434","last_updated":"2023-03-29T03:30:38Z","snapshot_observed_at":"2026-08-13T12:14:21.623734Z","submitted_at":"2023-03-29T03:30:38Z","title":"TaskMatrix.AI: Completing Tasks by Connecting Foundation Models with Millions of APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16434","snapshot_observed_at":"2026-08-11T20:07:35.112532Z","title":"Taskmatrix","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.112532Z"},"links":{"cited_paper":"/paper/2303.16434","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:7b5270ff46251ee47cc165b53902a7bc1c52fafd2c0a0b8a464bc0788127227e","observation_id":"d30e0b5d-2d1d-474a-8fa8-f127ab2ca0a4","resolution":{"observed_at":"2026-08-11T20:07:35.112532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.116877Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.116877Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:47f052403911978ab0d1e4ffae94c5392d0ff3eb79d4fbeed9efbe3b29b3e1ea","observation_id":"7aac7962-0107-4667-97c2-dc3c0ddbdc42","resolution":{"observed_at":"2026-08-11T20:07:35.116877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06804","last_updated":"2021-01-17T23:38:40Z","snapshot_observed_at":"2026-08-14T20:40:30.818371Z","submitted_at":"2021-01-17T23:38:40Z","title":"What Makes Good In-Context Examples for GPT-$3$?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06804","snapshot_observed_at":"2026-08-11T20:07:35.121142Z","title":"What makes good in-context examples for gpt-3? arXiv preprint arXiv:2101.06804, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.121142Z"},"links":{"cited_paper":"/paper/2101.06804","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:f765760ccdda7779375aa98e5489022a08cdbcb90b29f1958f9484017a36ec7b","observation_id":"45362e95-15fb-4c89-8693-8ec203febe44","resolution":{"observed_at":"2026-08-11T20:07:35.121142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.125515Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.125515Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:2dd92746da63cbc4390a63f140ecbe726939b845680cbfa0ef7af0b5b1749bee","observation_id":"2f8bbb6b-aecb-4b68-82e5-60a2859a1b70","resolution":{"observed_at":"2026-08-11T20:07:35.125515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06202","last_updated":"2023-03-22T21:05:49Z","snapshot_observed_at":"2026-08-13T13:23:15.193039Z","submitted_at":"2022-12-12T19:25:45Z","title":"Doubly Right Object Recognition: A Why Prompt for Visual Rationales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06202","snapshot_observed_at":"2026-08-11T20:07:35.129760Z","title":"Doubly right object recognition: A why prompt for visual rationales","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.129760Z"},"links":{"cited_paper":"/paper/2212.06202","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:1f560efcf54435fa4e9bf35e39694a9b5a938cc857f7dcbcda887be7e8ed8ec0","observation_id":"2ebb5d5d-09f0-449e-9592-09ef74a9d582","resolution":{"observed_at":"2026-08-11T20:07:35.129760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-13T14:05:48.329373Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-11T20:07:35.133678Z","title":"Visual classification via description from large language models.arXiv preprint arXiv:2210.07183, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.133678Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:0e473633039fc6578a5389ce39e1244e192700f0e3e053404460c7f5018b6f2c","observation_id":"ee22d62d-df0f-4d87-aa44-982c70adb750","resolution":{"observed_at":"2026-08-11T20:07:35.133678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.283031Z","title":"Neural prototype trees for interpretable fine-grained im- age recognition","venue":null,"work_id":"3d30b7d5-2708-41e7-b4ea-8762ffc97909","year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.137834Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:50c126a5152fdbafa271650744c3f5f3ffcf4b864b9da7d01725c317a8d236d1","observation_id":"a0795a4b-191d-4a6d-b6cd-e956b2da3e05","resolution":{"observed_at":"2026-08-11T20:07:36.287197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.270415Z","title":"Coco attributes: Attributes for people, animals, and objects","venue":null,"work_id":"a2cbc497-2f2f-4f49-958b-47ee7a166d89","year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.141437Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:618a723f58c833ded7148f2771df79a670967ed7a321b7672886c3fb1558c3c0","observation_id":"9eec07fe-0fe0-466c-9fb3-754417b9198a","resolution":{"observed_at":"2026-08-11T20:07:36.274560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13391","last_updated":"2023-06-28T10:26:46Z","snapshot_observed_at":"2026-08-13T12:18:18.999951Z","submitted_at":"2023-03-23T16:07:31Z","title":"Xplainer: From X-Ray Observations to Explainable Zero-Shot Diagnosis","version":3},"cited_work":{"arxiv_id":"2303.13391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.13391","snapshot_observed_at":"2026-08-11T20:07:35.540478Z","title":"Xplainer: From X-Ray Observations to Explainable Zero-Shot Diagnosis","venue":"cs.CV","work_id":"1e81fd9c-4740-4d4e-ad4f-342a25190e33","year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.145493Z"},"links":{"cited_paper":"/paper/2303.13391","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:e3dab5645e1ab2ddb117c6a89ecebedfb457317c8fe59caa5e0df40b8cc73d27","observation_id":"1b7d59e7-9bb8-4097-b7cd-e17e2d047650","resolution":{"observed_at":"2026-08-11T20:07:35.547233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.256871Z","title":"Learning to predict visual attributes in the wild","venue":null,"work_id":"d86b8a40-2d67-44d0-b3be-3a36e3c75b95","year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.149757Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:93b78cb1801a16aee61f5f8f309a70938c2bd814ee6a1208814ca800e5634df6","observation_id":"5871c619-2400-4e97-b4cb-bed5fdccaf16","resolution":{"observed_at":"2026-08-11T20:07:36.261771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.153673Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.153673Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:52ff8d207dbfc99b8f43225913fca7663f175cbcb1379817322928d63a48d141","observation_id":"fed01b56-a9b5-41bd-b631-c15969f2efa3","resolution":{"observed_at":"2026-08-11T20:07:35.153673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.235564Z","title":"Maximum common subgraph isomorphism algorithms for the matching of chemical structures","venue":null,"work_id":"68676fa1-dfba-4f76-adb4-43ef1a660c39","year":2002},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.158035Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:db826a4715ada8f1ed1566b7f74e9b6dd6d7318dee95e52ee311881b9ab64d42","observation_id":"87a05ac6-7a06-4738-9e24-10d78c3542b7","resolution":{"observed_at":"2026-08-11T20:07:36.239504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.223035Z","title":"why should I trust you?","venue":null,"work_id":"2cf626e2-cee5-493c-9eef-0502ae0ef0b4","year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.161908Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:eb9e3078eeb2a394f84f0d2670f8b73b06ca4ff7d0d65fe9dc5f2facbb50837f","observation_id":"7f07c63c-e633-467a-86ff-2c4ce46c6727","resolution":{"observed_at":"2026-08-11T20:07:36.227167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.165699Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.165699Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:90d0c43b78528ba55dc3639522873ef4ccf2fd9456a0037a20cb3462e7a3289b","observation_id":"ab3ff483-422b-4ab0-ae01-c0c90f4be7d7","resolution":{"observed_at":"2026-08-11T20:07:35.165699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.200265Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"7e6a4e8f-42ad-429d-9c09-dc5c7ccc1386","year":2015},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.169519Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:f4456f7150d47d17b8a6c03d17f053f2fd6dd269b4027e43fd0af2f9e9caf9a1","observation_id":"1367e644-4475-43c6-8553-4cb2f0d55192","resolution":{"observed_at":"2026-08-11T20:07:36.205510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.173384Z","title":"Protopshare: Prototypical parts sharing for similarity discovery in interpretable image classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.173384Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:e00e6fb9657f9c35808fcf9fd7298f90d69e57ad4d8c6f1b94b7c7ed39b2962e","observation_id":"0c1c8e91-b93b-4b96-aba5-6f268e79efd6","resolution":{"observed_at":"2026-08-11T20:07:35.173384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.178023Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.178023Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4ef041dfabcefbaaf717b571ef52ea5102f2b8d2ab4160c68b4114a3ac8eeb44","observation_id":"ee74399c-0b27-40fa-8266-52c954aedcdd","resolution":{"observed_at":"2026-08-11T20:07:35.178023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.171262Z","title":"Rule extraction from neural networks via decision tree induction","venue":null,"work_id":"14468c43-4f48-45cc-b259-7dea09152569","year":2001},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.182506Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:00ea7bce66aa0ee105e210bde55c9698e94ebb1f8b907f80cf1b9937c921f341","observation_id":"000088e9-98c3-4e6d-8457-398c45b882f8","resolution":{"observed_at":"2026-08-11T20:07:36.175606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-11T20:07:35.186448Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.186448Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:1b3a381add41a408bba7a26aeade841eb2efb17ea3db3ee4ad041344a25e30fa","observation_id":"ab04397f-8eec-458d-99a3-371d72371518","resolution":{"observed_at":"2026-08-11T20:07:35.186448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.191172Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.191172Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:db917732d8d07b5ae4fe0372004064ccab694cdd80051587ec7d6c480d9cbb95","observation_id":"0dfa9e74-b922-4476-92ce-91eda4cefb69","resolution":{"observed_at":"2026-08-11T20:07:35.191172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-12T12:50:51.005571Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-11T20:07:35.195048Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in huggingface","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.195048Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4805fa33341300eb5fba4db571dd767beff48275bf8fc55b02025a7ef26249ff","observation_id":"408783c6-f5d1-429b-89b4-e392b4dc34c6","resolution":{"observed_at":"2026-08-11T20:07:35.195048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.150163Z","title":"Learning important features through propagat- ing activation differences","venue":null,"work_id":"996c5092-c027-46c5-b951-dc1149ef633d","year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.199769Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:8508dea15548c40e06f13e93d79b24a8fe451cd640abcc0908b10fb52a0a9916","observation_id":"c8c8a90e-a304-461c-82b0-1225f4334e74","resolution":{"observed_at":"2026-08-11T20:07:36.154542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-11T20:07:35.204022Z","title":"Deep inside convolutional networks: Visualising image classification models and saliency maps","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.204022Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:131c02bda5349239ae9d79998ca6f4ca9227716f36a74f2dc317f4c084bc611b","observation_id":"4f432585-f6bb-495c-8a8a-cc68b2dd27e9","resolution":{"observed_at":"2026-08-11T20:07:35.204022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T20:07:35.208656Z","title":"Very deep convolutional networks for large-scale image recogni- tion","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.208656Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:dfde2f29c7e96169d7c7eb9978862e40cd5639778b89159f65a635c951c33844","observation_id":"fc6285cf-3876-41d7-b0ad-8bc420027a4e","resolution":{"observed_at":"2026-08-11T20:07:35.208656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.137633Z","title":"James Murdoch, and Bin Yu","venue":null,"work_id":"a61da31b-09a0-45ef-9e59-65143bb0574b","year":2019},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.213179Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a61f6eda1192c159c2a2845ab72f8926f57482f3d47a20a02373a02f667b102d","observation_id":"c1fa96b2-3b1d-47ee-95ce-b36cd698130d","resolution":{"observed_at":"2026-08-11T20:07:36.142062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-08-14T20:54:30.978618Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-11T20:07:35.216835Z","title":"Smoothgrad: removing noise by adding noise","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.216835Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:beec97f53f7adbb5d357fc9a1fd934cb1f3dc7e63a9aa84acf738289f2dfd9b1","observation_id":"d5415e60-4b4e-43a4-820d-72ab50358e66","resolution":{"observed_at":"2026-08-11T20:07:35.216835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.220974Z","title":"Prototypical networks for few-shot learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.220974Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a2d78f0710bd323550b4c67e76fb9522fae750c9dfd5b07759aedcc4ab2ff2a2","observation_id":"32855f1d-5339-4a54-8be9-015b75b3c3eb","resolution":{"observed_at":"2026-08-11T20:07:35.220974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.114633Z","title":"Neural trees-using neural nets in a tree classifier structure","venue":null,"work_id":"70365aed-5dca-4a24-871f-fe4b908a9c4b","year":1991},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.224786Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:911fb1da974bbb8967c3e435c243219f7908938ccd3ba55690ca034f9f7a2b2c","observation_id":"2b294a20-ba62-4f81-9cba-0fcb49a3bab9","resolution":{"observed_at":"2026-08-11T20:07:36.119510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.102148Z","title":"Tree sequence kernel for natural language","venue":null,"work_id":"70686599-3bc0-43a6-8e3e-8c860ddccb70","year":2011},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.228574Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:e4deb3d000fc2758f34033e3a0b69ef05ac52cee365ae6c59e0ebf23ef5a3e68","observation_id":"d7653afb-1897-4bf0-a6cc-bb2398cf34b6","resolution":{"observed_at":"2026-08-11T20:07:36.106327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.232239Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.232239Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:ec4f53f63a9979d8d06ad51256d5e81eaa94c01aeabc643071bf3dabeb833698","observation_id":"bd7b5a49-b624-4520-b810-c33b085fca85","resolution":{"observed_at":"2026-08-11T20:07:35.232239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.236073Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.236073Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:bbabdeebf7c548963d7259ad8098b7cb3ff465045aacef9268c403c4d1559022","observation_id":"223dc767-76cf-4ada-868d-df7a0ca15087","resolution":{"observed_at":"2026-08-11T20:07:35.236073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.070154Z","title":"Visual correspondence-based explanations improve ai robustness and human-ai team accuracy","venue":null,"work_id":"6af06e3b-fc7c-422a-9d9c-d83f72681608","year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.239674Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:a6de6f6ca4173d3481c0238a60546191fe35958ce49b291a5785ce8586de9796","observation_id":"a0e2e079-4e5b-4db8-b637-e095d8f0c257","resolution":{"observed_at":"2026-08-11T20:07:36.075258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.056205Z","title":"Adaptive neural trees","venue":null,"work_id":"2e74034f-d81d-4e87-9c54-b7c74a205dcb","year":2019},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.243542Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:63f12245cf0704644097e916999a164dda19c98deb5ea8e52a268d2545e3e597","observation_id":"121342dc-954d-4434-ae29-90744e4c7f44","resolution":{"observed_at":"2026-08-11T20:07:36.060849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.247420Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.247420Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:e139e4a7bf13d298c6178ce62d014a88f8705b7ca4a943d65a4186f574cfce88","observation_id":"52ea45d8-eea2-4a02-93b6-1a4eaaf3138a","resolution":{"observed_at":"2026-08-11T20:07:35.247420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00221","last_updated":"2021-01-28T03:06:26Z","snapshot_observed_at":"2026-08-15T12:25:48.263583Z","submitted_at":"2020-04-01T04:04:03Z","title":"NBDT: Neural-Backed Decision Trees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00221","snapshot_observed_at":"2026-08-11T20:07:35.251283Z","title":"Nbdt: neural-backed decision trees","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.251283Z"},"links":{"cited_paper":"/paper/2004.00221","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:ce7e1798d513e66f932d67a668710fd2b81c994cebbcb398018ec6f82e777660","observation_id":"b9446a37-73e3-4187-a810-1ef73f073e60","resolution":{"observed_at":"2026-08-11T20:07:35.251283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.255610Z","title":"Chestx-ray8: Hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.255610Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:7ce2663ed72da0ce169f63dff6369f35ecbcda875769f1c88a0577e0ff59e6eb","observation_id":"f9f7b7d7-cc84-4119-baed-714e8e1753ba","resolution":{"observed_at":"2026-08-11T20:07:35.255610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:36.021340Z","title":"A tree-based decoder for neural machine translation","venue":null,"work_id":"71f8ca26-b153-45d0-99c4-42972b78a21f","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.260080Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:fda1e1c8212979c44cf1582a5d75786a526345d7be521e67450bcc9d27d46722","observation_id":"ba2397b0-19e5-4056-ba89-d2f04f01093a","resolution":{"observed_at":"2026-08-11T20:07:36.025760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-14T21:04:14.517226Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-11T20:07:35.264243Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.264243Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6f529864aaa64f89e917ffb9cccc62508aa7ba0e44058b0eedd5ca06393100bd","observation_id":"dde06ef2-8311-47b9-98ff-33916e4441a2","resolution":{"observed_at":"2026-08-11T20:07:35.264243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.269179Z","title":"Zero-shot learning—a compre- hensive evaluation of the good, the bad and the ugly","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.269179Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:346ba0c71ee0a3b87ae9964502e07ffc618eefd74d13a252fd1b7ea60f51767a","observation_id":"3ad0d013-b7ac-47e1-b349-929c8d6a8f22","resolution":{"observed_at":"2026-08-11T20:07:35.269179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.991576Z","title":"Attribute prototype network for zero-shot learning","venue":null,"work_id":"da11fdf3-3d50-4cde-bce3-918d822a5c93","year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.273865Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6d3bb8cd578448642167dbacc0918c58e58c6c517f0aa05cad8968d3f279b92f","observation_id":"0bad459e-d433-470b-bb02-a03e20c937f6","resolution":{"observed_at":"2026-08-11T20:07:35.997304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.976830Z","title":"Factorizing knowledge in neural networks","venue":null,"work_id":"7ca5b334-1896-4baf-909e-a37885c1642a","year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.278441Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:b48625d64dde759935639d466ac84038ad1643bd504182210d94cd7a98e1676b","observation_id":"238cfb74-64f7-467d-b679-71025aad6e47","resolution":{"observed_at":"2026-08-11T20:07:35.981894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.282678Z","title":"Deep model reassembly","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.282678Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:56e44e5dd43bf3441f42a32aaca0b5cf98e3ccfa150ecedb525d8413f69c79aa","observation_id":"019fd634-aa22-4e7d-86d5-d88f70d79f1f","resolution":{"observed_at":"2026-08-11T20:07:35.282678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06988","last_updated":"2018-06-19T00:05:20Z","snapshot_observed_at":"2026-08-14T19:02:12.524813Z","submitted_at":"2018-06-19T00:05:20Z","title":"Deep Neural Decision Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06988","snapshot_observed_at":"2026-08-11T20:07:35.288080Z","title":"Deep neural decision trees","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.288080Z"},"links":{"cited_paper":"/paper/1806.06988","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:bf3bfe2b1490418614e5dd3f969c4f1685758e587d614d8af00d4b92fabb6c24","observation_id":"9c9a57d8-6ce2-43f1-b2d4-e73d6d6d3f38","resolution":{"observed_at":"2026-08-11T20:07:35.288080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.944640Z","title":"Language in a bottle: Language model guided concept bottlenecks for interpretable image classification","venue":null,"work_id":"d1df241e-7db8-4e1f-999a-e5d677dad2b5","year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.292662Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:04e15edf667c082a14e6c7311f3e1b0c1fa4f286da51fb46cb8ed97d42da888a","observation_id":"ab3045e6-3680-4036-bae6-a84d8bb34101","resolution":{"observed_at":"2026-08-11T20:07:35.949256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-11T20:07:35.297119Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.297119Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:bea2bdfdfdfa4371c37ef168589b65ac2314b460e0ef8851d769fb6b3a90a7cc","observation_id":"7b9ca1a5-f80f-417e-b28e-f073de009633","resolution":{"observed_at":"2026-08-11T20:07:35.297119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.930906Z","title":"Representer point selection for explaining deep neural networks","venue":null,"work_id":"0bf621cb-9d9f-40d1-b1bd-bc4bf7c51e43","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.301691Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6230fabbf3265261b8d8ee8a02ff9cbe60056325b30767ef13bbbe11d1ec3aba","observation_id":"8ecfed26-821e-43ee-858d-9eff72c03f60","resolution":{"observed_at":"2026-08-11T20:07:35.935637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.916759Z","title":"Neural- symbolic vqa: Disentangling reasoning from vision and language understanding","venue":null,"work_id":"67aadac3-a8a0-4b39-bd49-aab9f203541f","year":2018},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.305615Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:27c2ac804fa5f98528185fb4645603c84d366232ec3f1458e3a22b78ee49cefe","observation_id":"23a6f7d5-9969-42e5-9246-297f4428407e","resolution":{"observed_at":"2026-08-11T20:07:35.921677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.309562Z","title":"Visualizing and understanding convolutional networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.309562Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:54944f576ad7cf9c52e52ea080034c9bbf29aa358c63ae9c7c3f419b6fd027b8","observation_id":"62beda2f-1292-4c70-8aed-56a1a4065caa","resolution":{"observed_at":"2026-08-11T20:07:35.309562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-11T20:07:35.313817Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.313817Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:ce3c39311bc03bf1f71583fc3bd075ffa6c781f9ce8707a88a26e2380d74927f","observation_id":"73d66753-5129-464a-bb72-60d2d4e26ff7","resolution":{"observed_at":"2026-08-11T20:07:35.313817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.893322Z","title":"Use all the labels: A hierarchical multi-label contrastive learning framework","venue":null,"work_id":"ca9e99a9-65fc-4b53-96c1-a8d0780a032b","year":2022},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.318375Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:8e08549b8ccbb79a35c15058d3799ea70dc75e955629462b8e9622609a55ec1e","observation_id":"9db7e0eb-7e5b-4419-be83-dcdc2797d95e","resolution":{"observed_at":"2026-08-11T20:07:35.898108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.877578Z","title":"Diagnosing and rectifying vision models using language","venue":null,"work_id":"f5494b6d-9e4c-4861-80fc-a8044b50646c","year":2023},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.322670Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:1c8f7e6113c0cb0c422e5ba9ad3caaba5e938bc9f7598ccd8e6ac633c337522b","observation_id":"55f368ce-dd45-4271-b6ef-3433280562ce","resolution":{"observed_at":"2026-08-11T20:07:35.882378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.863145Z","title":"Evolutionary design of neural network tree-integration of decision tree, neural network and ga","venue":null,"work_id":"26a53d59-114b-4e80-82a8-84ad6e5af506","year":2001},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.327473Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:b6d30f88971b11347b99b7f342916acfeca9a28aeb222aeae21563e8bfb99fff","observation_id":"04b7c9f0-dc56-4db6-9cd3-2e96ebbe2408","resolution":{"observed_at":"2026-08-11T20:07:35.867501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.850089Z","title":"Evaluating commonsense in pre-trained language models","venue":null,"work_id":"7b5cb257-0650-4058-bf73-c0e6782f0af7","year":2020},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.331577Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:edbd02dec89f7dc5e05f1a4818baea6d7cefb00c15a107e326b62cb507736206","observation_id":"9d66f4cc-8b04-48ad-9120-5bd7c8c4f8c1","resolution":{"observed_at":"2026-08-11T20:07:35.854722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.836986Z","title":"Deepred–rule extraction from deep neural networks","venue":null,"work_id":"67a70e48-8969-4367-a3d3-adef4adc73c6","year":2016},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.335362Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:6a9dc98e32d6f6ce1ed1e416038541dc08ae7ea1465428bc81fceaa0b8f488e8","observation_id":"f0d54ef9-b2c5-4724-b7ea-c3a8cc0e0af4","resolution":{"observed_at":"2026-08-11T20:07:35.841264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.824889Z","title":"In this first step, we utilized ChatGPT 4 to generate initial attribute trees for each class with the category name, detailed Section 3.1","venue":null,"work_id":"8112ff0d-3a6c-4fde-ba3b-455738f7f1ef","year":null},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.339576Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:0fdfdf088906680d1ab378fe0e24ac444e39fae6099a651fa9367443c64b067c","observation_id":"d0e55e4c-82d2-4c0c-93a1-8e4bbd0531b2","resolution":{"observed_at":"2026-08-11T20:07:35.829073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.810113Z","title":"To determine whether an attribute was present or absent in an image, we employed an ensemble of predictions from multiple CLIP [53] models 5","venue":null,"work_id":"56c2bd41-3cb9-4d9f-a1f2-13738ac09dba","year":null},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.343498Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:b91f54f441f23706385bb3e92a69f71ae9b3dced03a6bc49fc07a03e6fe2a157","observation_id":"14b0e640-0850-44a6-b0e3-002798340b66","resolution":{"observed_at":"2026-08-11T20:07:35.815519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.796735Z","title":"crane” could represent either a construction machine or a bird, leading to ambiguity. Furthermore, an image described as “a dog with a long tail","venue":null,"work_id":"35f44daa-8c98-4c93-8a77-9fb68a394daf","year":null},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.348240Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:4b30750a5ac29c2785f067d6a8dc3d7a0d0f28563dd9e3d10ce75d2efc0d8138","observation_id":"9af1c2fe-9c1d-4526-8a32-275d0c750f35","resolution":{"observed_at":"2026-08-11T20:07:35.801610Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:07:35.782465Z","title":null,"venue":null,"work_id":"8d0cb7e4-7611-4805-a8bc-7ae48e65ce28","year":null},"citing_paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T20:07:35.352999Z"},"links":{"citing_paper":"/paper/2412.07802"},"observation_digest":"sha256:23b8e7532b31c61749b975b48eb5ff7409d467ffdfbd4e8a73ea86df152ae75b","observation_id":"de991cee-695d-4af1-bf63-91fbf7ed9df8","resolution":{"observed_at":"2026-08-11T20:07:35.786802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07802","last_updated":"2024-12-08T20:46:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:59:45.317112Z","submitted_at":"2024-12-08T20:46:23Z","title":"Language Model as Visual Explainer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 0 inbound Pith citation observations for arXiv:2412.07802."}