{"as_of":"2026-08-10T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66d42ce09d65c8605e3e3592c5b375d9686f25156f53a998a7af4bb0507215bc","coverage":[{"denominator":251,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:59:11.105981Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05258/citation-record","integrity":"/paper/2608.05258/integrity","json":"/paper/2608.05258/citation-record.json","paper":"/paper/2608.05258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.556089Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.556089Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d3b2aa9f4c276e32b5e634424682ee64963d84d67661cc008383307d796b6736","observation_id":"d11799d7-cbac-4c50-a9c6-c44c89d41f55","resolution":{"observed_at":"2026-08-08T16:59:10.556089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.561346Z","title":"Representation learning and na- ture encoded fusion for heterogeneous sensor networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.561346Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:055c7b6011989b2b780c7fb2c6698c17d447ec834d2d594c4dc32e5c72bd39dc","observation_id":"6f4bef24-111c-4059-9ebc-51ec3ae2795f","resolution":{"observed_at":"2026-08-08T16:59:10.561346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.565742Z","title":"Congestion aware dynamic user association in heterogeneous cellular network: A stochastic decision approach,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.565742Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:43cd4e8e2ffe475ad90fb454928470db1b679e0da1327c933c0a9d5a6fefdeaf","observation_id":"0e2d9a63-413d-4eb4-9378-4d3f3b328dee","resolution":{"observed_at":"2026-08-08T16:59:10.565742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.570437Z","title":"Enhanced robustness by symmetry enforcement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.570437Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:fce8904b14b99e76094159f6886a3e9a4135f050db1991ed5601a218df7ee1c5","observation_id":"165e5521-1a09-4255-b96d-1b3629368d1d","resolution":{"observed_at":"2026-08-08T16:59:10.570437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.575167Z","title":"Partial interference alignment for heterogeneous cellular networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.575167Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2f819e7544cf3c8ba7f210192a83f6569514f2a7db6aa8cb338bd1057aca0b19","observation_id":"0a432fff-c026-428e-b74b-259d3a45497a","resolution":{"observed_at":"2026-08-08T16:59:10.575167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.580043Z","title":"Optimization for user centric massive mimo cell free networks via large system analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.580043Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:03832c0395641855f7d0a93f26d80238480d5e72025287c1b7ec8f4f49deba54","observation_id":"d61ebdc0-a3e0-4c47-9539-b20da33af6c3","resolution":{"observed_at":"2026-08-08T16:59:10.580043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.589472Z","title":"Exploration vs exploitation for distributed channel access in cognitive radio networks: A multi-user case study,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.589472Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:20ac68d0bb1620b29e21c7fb27b2578d2291a8d2a8463749ffb7d52bbca7b394","observation_id":"2ee2b689-e79e-4419-9d9c-87ebb4c5be66","resolution":{"observed_at":"2026-08-08T16:59:10.589472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.593676Z","title":"Deep reinforcement learning based computation offloading for mobility-aware edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.593676Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e45e5d6bb125f153a2bd32630dae795bdd83af52c283ccc6c7dd0bc6229b8651","observation_id":"9fa2d7cb-02eb-49cc-9232-b08d59763459","resolution":{"observed_at":"2026-08-08T16:59:10.593676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.598216Z","title":"Performance analysis of co- operative multicell precoding with global csi and local individual csi in the large dimensional regime,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.598216Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:4fb6888a17e49a758116a5600163a3ae829358759683161143418e3f0dcba3dc","observation_id":"e4dffcba-d670-4690-a55a-66053719d781","resolution":{"observed_at":"2026-08-08T16:59:10.598216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.602562Z","title":"Low complexity optimization for user centric cel- lular networks via large dimensional analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.602562Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7464c90fc18a2882f220eafe4bfba20e3bafc0d36e24228928b422748decc269","observation_id":"436732dc-d1bc-4b90-83ff-e0eb42420b21","resolution":{"observed_at":"2026-08-08T16:59:10.602562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.607014Z","title":"Improving robustness of deep neural networks via large-difference transformation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.607014Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:471aca1f4afe178cdce41b4ad4e3f0960b59ccc727d0b8a2b1a5b4f3ee9d0cf1","observation_id":"080326ea-9f1c-40ed-a3a6-f66ce1a212ab","resolution":{"observed_at":"2026-08-08T16:59:10.607014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.611370Z","title":"Looking beyond content: Modeling and detection of fake news from a social context perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.611370Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:17c7e3f0f6b9fc2bea5c130257204f179a4666ae1da81f3929ce38b75bce6409","observation_id":"c0a28969-e207-40c6-b238-b9141d7a21a9","resolution":{"observed_at":"2026-08-08T16:59:10.611370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.615627Z","title":"Large system analysis for densification of cellular networks with massive mimo,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.615627Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:10b47490dba1d8af509c57f2dc5a6857a90d04bb66de185d3ab47c7e711870b9","observation_id":"b70425f5-9a7f-40fa-a5f3-fc1c4fc27c6d","resolution":{"observed_at":"2026-08-08T16:59:10.615627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.620148Z","title":"Collabora- tive spectrum sharing based on information pooling for cognitive radio networks with channel heterogeneity,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.620148Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ba97f05e25fda51aff8a4871403d4956cbee8a2b114ca9b5c4fdc157cd09e445","observation_id":"a73bec4b-fc33-4bd0-ae8e-aa38cba8ae2e","resolution":{"observed_at":"2026-08-08T16:59:10.620148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07022","last_updated":"2024-12-09T22:09:13Z","snapshot_observed_at":"2026-08-07T21:27:10.375359Z","submitted_at":"2024-12-09T22:09:13Z","title":"Dense Cross-Connected Ensemble Convolutional Neural Networks for Enhanced Model Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07022","snapshot_observed_at":"2026-08-08T16:59:10.624519Z","title":"Dense cross-connected ensemble convolutional neural networks for enhanced model robustness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.624519Z"},"links":{"cited_paper":"/paper/2412.07022","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7408dae49e6f79db4920c687baa3a4a3b3b0892946d8eb5c1023d1cff727e2a2","observation_id":"4187ea7e-2c05-4ca1-aa10-17fbc28ccd8d","resolution":{"observed_at":"2026-08-08T16:59:10.624519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.629428Z","title":"Information theory and represen- tation learning inspired multimodal data fusion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.629428Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:cb9517060acfda1c83130c776e29e507c82cb10595221ab7ffd8a48aa7974b6d","observation_id":"8a2fd787-2e48-4a4b-9cd7-e89decb85427","resolution":{"observed_at":"2026-08-08T16:59:10.629428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19747","last_updated":"2024-12-27T17:14:52Z","snapshot_observed_at":"2026-08-07T07:17:12.623382Z","submitted_at":"2024-12-27T17:14:52Z","title":"Enhancing Adversarial Robustness of Deep Neural Networks Through Supervised Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2412.19747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19747","snapshot_observed_at":"2026-08-08T16:59:12.281657Z","title":"Enhancing Adversarial Robustness of Deep Neural Networks Through Supervised Contrastive Learning","venue":"cs.LG","work_id":"aae96f56-4ea0-4f74-ae2c-9853be91aaf7","year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.638625Z"},"links":{"cited_paper":"/paper/2412.19747","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:eaf12273651adf63f6c62a3bfcd4703178b573fd7ad98da17d9749382cfdb136","observation_id":"560e8a2e-44dc-4470-a3d9-6adbcdc5c858","resolution":{"observed_at":"2026-08-08T16:59:12.286699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.647891Z","title":"Multi-scale unrectified push-pull with channel attention for enhanced corruption robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.647891Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:33b8c5e4ce892ed9ad3f4f8d27f4154fd61c35c016235eed4b61400debbf87f4","observation_id":"5bf5c5cb-b07f-465f-b50e-d916ce2e0b23","resolution":{"observed_at":"2026-08-08T16:59:10.647891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.652271Z","title":"Expert-guided ex- plainable few-shot learning for medical image diagnosis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.652271Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bd238453bcb3a464334138a81e39ee029ba4580542d2db5314e303f9e18bcfa5","observation_id":"fa094813-9e56-4e25-adf3-58b74e9fbf87","resolution":{"observed_at":"2026-08-08T16:59:10.652271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04682","last_updated":"2026-06-10T18:21:11Z","snapshot_observed_at":"2026-08-07T21:27:04.727006Z","submitted_at":"2025-09-04T22:03:05Z","title":"GetNetUPAM: Ecologically Informed Nested Cross-Validation and Noise-Robust Attention for Marine Bioacoustic Monitoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04682","snapshot_observed_at":"2026-08-08T16:59:10.656692Z","title":"Ecologically valid benchmarking and adaptive attention: Scalable marine bioacoustic monitoring,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.656692Z"},"links":{"cited_paper":"/paper/2509.04682","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:5633e2db972f9753b5f7b9e8fe5581dc1616604168385f3e88e7ea10271adc78","observation_id":"ebb2d243-fe70-4e43-9158-7b3e6fd6f25b","resolution":{"observed_at":"2026-08-08T16:59:10.656692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.661437Z","title":"Shape-aware thoracic edge map chest x- ray representation for pulmonary abnormality screening,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.661437Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7c446cb813ac055b8dae653f7cdc9a7fb24185e76e1cc6758437ac738c1287f7","observation_id":"0a9a379b-e784-4fb8-8ece-6d18600a778f","resolution":{"observed_at":"2026-08-08T16:59:10.661437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.665772Z","title":"Expert-guided ex- plainable few-shot learning with active sample selection for medical image analysis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.665772Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f6c9b7dd393e6e321b9eb455aa23dfd22688f28c74311ab2117967a7ede79c9e","observation_id":"2c2acf1c-776b-434b-ae53-208c6063aa2d","resolution":{"observed_at":"2026-08-08T16:59:10.665772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-08T16:59:10.670721Z","title":"Coswin: Convolution enhanced hierarchical shifted win- dow attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.670721Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0bc1d800004def4083be193e6cb4ad9ab30405682c58e2855ea5364d8c4f0cbc","observation_id":"17e6e87b-f390-4c29-88ef-d4a356b0cd8e","resolution":{"observed_at":"2026-08-08T16:59:10.670721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.679820Z","title":"Channel-selected stratified nested cross- validation for clinically relevant eeg-based parkinson’s disease detection,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.679820Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:85f0598092adaec4606458e892e8f4ff24f586b2ac04d57792799b9b44861aa5","observation_id":"308bf2a7-06f6-41e5-b35c-9e8d88885f42","resolution":{"observed_at":"2026-08-08T16:59:10.679820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.688548Z","title":"Promoting shape bias in cnns: Frequency-based and contrastive regularization for corruption robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.688548Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bcf3b6b352950e5ff98f6fc2f41e1faa5315f20077124eb9e5934fd1f210c9df","observation_id":"5a839a49-aa0d-45fb-a851-9a253daada16","resolution":{"observed_at":"2026-08-08T16:59:10.688548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.692920Z","title":"Learning to select like humans: Explainable active learning for medical imaging,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.692920Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ad77cd01906af2f98e2a9da57317581420dcb5b979098580c46997619605d67e","observation_id":"68879a51-1b9a-4caf-99e1-89967ab390f8","resolution":{"observed_at":"2026-08-08T16:59:10.692920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04548","last_updated":"2026-07-05T23:36:36Z","snapshot_observed_at":"2026-08-08T03:02:23.476662Z","submitted_at":"2026-07-05T23:36:36Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","version":1},"cited_work":{"arxiv_id":"2607.04548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04548","snapshot_observed_at":"2026-08-08T16:59:12.215878Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","venue":"cs.CV","work_id":"fa0e86a2-f5ec-4368-8899-4b72ebf79b48","year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.697321Z"},"links":{"cited_paper":"/paper/2607.04548","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:5f22796b5defbe389d5aa8c2e571b90236e9d1afc6305456b4bc7093cabe3e8c","observation_id":"5e0d7a4c-b915-49b8-803f-988056107507","resolution":{"observed_at":"2026-08-08T16:59:12.233533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07903","last_updated":"2026-07-08T20:31:06Z","snapshot_observed_at":"2026-08-07T02:48:01.295589Z","submitted_at":"2026-07-08T20:31:06Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","version":1},"cited_work":{"arxiv_id":"2607.07903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07903","snapshot_observed_at":"2026-08-08T16:59:12.165147Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","venue":"cs.CR","work_id":"1526e676-be47-4a0d-9a5d-a3e6b900ba11","year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.702144Z"},"links":{"cited_paper":"/paper/2607.07903","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:781eb775bfe34e14fd6a3792dbd081956e9990a22aac1b8497b44bc302f8ff58","observation_id":"1887b201-8937-4113-8006-45742510055d","resolution":{"observed_at":"2026-08-08T16:59:12.188293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.706882Z","title":"Frequency-aware contrastive learning for robust shape- biased convolutional neural networks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.706882Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f060c5f37abe6003645d84f6830c313531dd4f5464c9d597aef5ff50631193b8","observation_id":"785d0c0a-8fd3-48d4-8273-6b16a02a5c28","resolution":{"observed_at":"2026-08-08T16:59:10.706882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.715737Z","title":"Large dimensional analysis of cooperative multicell precoding with local individual csi,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.715737Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bc98fa495495bfb807a46211899d666e2a331cc25ac0776fce50f2b9554feb73","observation_id":"0eb09aea-aa89-4ab3-912a-63997d1f0ec2","resolution":{"observed_at":"2026-08-08T16:59:10.715737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.720161Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.720161Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:b786c8402bb6e57789814f3fe2a4a8432bd888fab52838998f1aff4ee894a0b2","observation_id":"76993563-aada-40e3-8a68-19ca3b42c1ad","resolution":{"observed_at":"2026-08-08T16:59:10.720161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.724493Z","title":"Pytorch library for cam methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.724493Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c14e917f72a5c85df34f40b67e6049a3b95fcff22311841fb11c686e879b74e6","observation_id":"c152891f-6aea-4391-9770-f81c10223d9d","resolution":{"observed_at":"2026-08-08T16:59:10.724493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.729099Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.729099Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9bdf20c7ece383c0825b0db7fccebe657ca8dd79c26e51de4483e7b964f24d69","observation_id":"abf010bf-e3a3-4d15-b72c-98b4ee4e40eb","resolution":{"observed_at":"2026-08-08T16:59:10.729099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.733515Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.733515Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3d0fb3f0b352c66b60dbffcace552153b869b55fb711945865393f8bd30b9eff","observation_id":"dee03cc4-5b09-42d9-a478-cde19bd6ed33","resolution":{"observed_at":"2026-08-08T16:59:10.733515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.746918Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.746918Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:743a4e2ae2a0bed92134c05fdeedfdfcd9ac444bd780c00447841a3602c50daa","observation_id":"b840d73a-bd35-41ba-b90e-c89e2322738a","resolution":{"observed_at":"2026-08-08T16:59:10.746918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.751469Z","title":"Training data-efficient image trans- formers &; distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.751469Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:44773990b2e39c2bf11902d8fdde0797828b41dc4aecc34126e063bcb887ebff","observation_id":"a6c68623-1328-45ae-ab66-0afe03014e9f","resolution":{"observed_at":"2026-08-08T16:59:10.751469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.755770Z","title":"Grad-CAM++: Generalized Gradient- Based Visual Explanations for Deep Convolutional Net- works ,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.755770Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9b8ab4209083bde34ac1aec1ada66b8e80b5c095c17a7186e05df815f244aeb7","observation_id":"696a8e51-6cb3-42bd-88a1-ce695928b7bc","resolution":{"observed_at":"2026-08-08T16:59:10.755770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.773034Z","title":"Ablation-CAM: Visual Explanations for Deep Convolutional Network via Gradient-free Localization ,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.773034Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9ae03c4ef3e00ff0afd2fc173de8eeec96beb221ef19361334114c8e383f7d27","observation_id":"6414c085-63b4-4f74-8954-2810626e624f","resolution":{"observed_at":"2026-08-08T16:59:10.773034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.777847Z","title":"Full-gradient representation 18 for neural network visualization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.777847Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8efae1c00402d579f5db79d602cbcba6ee08fd678b9e9cfe953a92da3565da22","observation_id":"82ef59c6-4706-47f0-a4d7-7dba82f80efd","resolution":{"observed_at":"2026-08-08T16:59:10.777847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.782410Z","title":"Axiom-based grad-cam: Towards accurate visualization and explanation of cnns,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.782410Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d00d2ec475a9418b936c749f85b93900203342f843549104393dba2507baa3e6","observation_id":"5fed5e13-e4f3-403a-b455-b126fd1519d5","resolution":{"observed_at":"2026-08-08T16:59:10.782410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.786756Z","title":"Learning Deep Features for Discriminative Lo- calization ,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.786756Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:358a67921bce9f2c083c11a07631ad54744fba0131ff9138e4d7ccdec6612168","observation_id":"cd3ccd1c-3dec-4a3a-9b36-2839533aabb0","resolution":{"observed_at":"2026-08-08T16:59:10.786756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.808587Z","title":"Boosting the transferability of adversarial attack on vision transformer with adaptive token tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.808587Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d2d5fdfbcfa9370ecdf8ce4bb7ca410046560e65420740f581abc7e4142c329d","observation_id":"e5ef305a-6724-4d60-857d-ce9c68ff429a","resolution":{"observed_at":"2026-08-08T16:59:10.808587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.826360Z","title":"Emergent open-vocabulary semantic segmentation from off-the- shelf vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.826360Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:685d224c83519ac875588f4fef31461502d64f383e0ffc0bb9509206bddfde02","observation_id":"16c8297c-2f6b-4232-8c4e-fbe9ed8eba55","resolution":{"observed_at":"2026-08-08T16:59:10.826360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.843724Z","title":"Enhancing prompt generation with adaptive refinement for camouflaged object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.843724Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e677a6e13721d5d7590258c76476364d211474324d7ae00ac7416e44d9865f45","observation_id":"56931160-3718-46e4-a740-1a38aa352710","resolution":{"observed_at":"2026-08-08T16:59:10.843724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.848312Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.848312Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ee6d6475b2bb3ee1e2e8d39c0177296026b08b8f599accf5d83909d5e734d182","observation_id":"be5f9b4b-445c-4075-b715-e6e5f63cc018","resolution":{"observed_at":"2026-08-08T16:59:10.848312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.854375Z","title":"Unlike attention-map adaptations, the method operates on feature activations from the MLP in the final transformer blocks and uses the true-label class score as the gradient target","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.854375Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:6d003f5fbff3c312d9925c8002f9d0963eb3201424a87a97c22b4a91f2499406","observation_id":"66fc7b3d-3284-4d49-90a0-16d4df5bba58","resolution":{"observed_at":"2026-08-08T16:59:10.854375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.859102Z","title":"the best way we found to apply GradCAM was to treat the last attention layer’s [CLS] token as the designated feature map,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.859102Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:68edaa8d41fd96b1d4aff32a7ff442b7784d19ff4b359983517ab9f542a8aac1","observation_id":"e7d02dc3-01c1-42c1-8479-e6d76c39c4dd","resolution":{"observed_at":"2026-08-08T16:59:10.859102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.863825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.863825Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0c4bdaf2fce4e7f8ad8e70defbab5d5016f791c37f0026223facc1cbcda7bbc9","observation_id":"11f0496e-6463-4aa2-8fbc-b70039ffd91b","resolution":{"observed_at":"2026-08-08T16:59:10.863825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.868882Z","title":"Rather than using an attention map as the attribution representation, the method operates on token-level feature activations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.868882Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:1ef1eec5b266cd4161549ce2cf9b91973f8e79165c1f25ee4dc45c72be3be6c8","observation_id":"b3a3ab5f-8b3b-4e34-9e52-235dae4b36c1","resolution":{"observed_at":"2026-08-08T16:59:10.868882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.873765Z","title":"Rather than operating on attention maps, it fuses gradients and intermediate ViT features from a selected transformer layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.873765Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:a3037eb4cc0752c096285797593ea43e5cd32d993342bd9529d4741ca0f29172","observation_id":"df55f346-798b-46c6-84f3-1a175cd1ff09","resolution":{"observed_at":"2026-08-08T16:59:10.873765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.879223Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.879223Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:91e47c476de6b9c34333ce44af3d04e62437d5ecb086fc4355b485dc10bc3aa6","observation_id":"03d04be6-ae68-4e9e-96cd-af6d03164695","resolution":{"observed_at":"2026-08-08T16:59:10.879223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.884275Z","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation [11]is best charac- terized as an attention-map-based attribution method","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.884275Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2d7c5e1abd78cdef5467213194a3b47fe8fe456b1c62dde251a6f2f9a99e7d38","observation_id":"a7d66fd2-ced5-4a14-9c46-570c15028ffe","resolution":{"observed_at":"2026-08-08T16:59:10.884275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.889056Z","title":"matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.889056Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:880652c758d93a64ce548e3c0ed2351a22fe1d9ce2baf98233d1c85c6b7b59b9","observation_id":"ea63f919-8c90-4164-b286-bae2091db538","resolution":{"observed_at":"2026-08-08T16:59:10.889056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.893576Z","title":"A dog on a white bed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.893576Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:92caf5ca7f66bb0e5b9d85ce1a0d8d2077c22dbece4bdb585fef2b5d146d924e","observation_id":"896927b2-4c58-4e89-bab1-255af39476c8","resolution":{"observed_at":"2026-08-08T16:59:10.893576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.897806Z","title":"Grad-cam: Visual explana- tions from deep networks via gradient-based localiza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.897806Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:cd052c59e61b91d65982a79fd0cebd740d51ef605159904918288d68b88fbc8b","observation_id":"89e53fb0-a68d-40e6-9a66-da144f0ab390","resolution":{"observed_at":"2026-08-08T16:59:10.897806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.901874Z","title":"BLIP: Bootstrap- ping language-image pre-training for unified vision- language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.901874Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:aa7f520418b209183b0783b0bbb4db724430178e3b0c25ed326b9e22b4697527","observation_id":"54a8e770-36e0-4c28-96ff-64fa6d237f88","resolution":{"observed_at":"2026-08-08T16:59:10.901874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.906013Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.906013Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:de973fa19c472a108ccfe3d8ea400f78c06395bbe99728e12eb381ea730de896","observation_id":"d76fc51a-f104-4dbe-b7ad-4d69d5bbb578","resolution":{"observed_at":"2026-08-08T16:59:10.906013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.910505Z","title":"Transformer in- terpretability beyond attention visualization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.910505Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8be42c6867026ea7ff8716d8746bf9089a94c41b9545344687dc05d0a0e57160","observation_id":"bcd781eb-9620-480d-9bd2-343bcd340632","resolution":{"observed_at":"2026-08-08T16:59:10.910505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.914869Z","title":"Transreid: Transformer-based object re-identification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.914869Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:13d2dac1ef321f3ce801bfc22d8cd733f620bca975c71aef64166392d49570d6","observation_id":"348bd8db-0aa6-4056-a8e9-124e79fe93b7","resolution":{"observed_at":"2026-08-08T16:59:10.914869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.918840Z","title":"Generic attentiemer- gent on-model explainability for interpreting bi-modal and encoder-decoder transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.918840Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d6ee1d766cbbd887987bdea5e9e9122586361f0694acc96b829be3f0dc42b997","observation_id":"e30f169d-cf73-4ba5-a336-278ebc76c72e","resolution":{"observed_at":"2026-08-08T16:59:10.918840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.923344Z","title":"Ia-redˆ2: Interpretability-aware redundancy reduction for vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.923344Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:b4ab6cedbb14af6bb9caf6a635b22602cc65f1f151e1176752741743dfecd7f8","observation_id":"572b76d5-12af-4075-b5b9-679acd5c8875","resolution":{"observed_at":"2026-08-08T16:59:10.923344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.927583Z","title":"Analogous to evolutionary algorithm: Designing a unified sequence model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.927583Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e9a9f1cf4431ae9676d09404d7085f14be9e963a50dcba1e6a2ea574fe770fca","observation_id":"529da6a4-e53c-4da3-b876-01c18d88157d","resolution":{"observed_at":"2026-08-08T16:59:10.927583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.932385Z","title":"Passive attention in artificial neural networks predicts human visual selectivity,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.932385Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0bc7a067593b72f0198c83e58f9d45c59b787e8eed1226ae77f8046027e63354","observation_id":"3332e09e-68ef-453d-974c-e65a0d2ab1b4","resolution":{"observed_at":"2026-08-08T16:59:10.932385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.936914Z","title":"Vitae: Vision transformer advanced by exploring intrinsic inductive bias,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.936914Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:145f26b52e7b95f65f80fe0c11754987e36ec033d924c508210d6552365c7ab1","observation_id":"f616e9ae-43fe-4b85-9ff3-fcc8cee7ec56","resolution":{"observed_at":"2026-08-08T16:59:10.936914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.941698Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.941698Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:150319a837c1fb31a17be61db464bdd27026deca327202f3e7d3bec4b9a5de01","observation_id":"7a6cbe1b-3acb-4ea5-aedd-678e82902f72","resolution":{"observed_at":"2026-08-08T16:59:10.941698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09374","last_updated":"2022-08-19T14:39:18Z","snapshot_observed_at":"2026-07-06T13:43:32.141581Z","submitted_at":"2022-08-19T14:39:18Z","title":"VLMAE: Vision-Language Masked Autoencoder","version":1},"cited_work":{"arxiv_id":"2208.09374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.09374","snapshot_observed_at":"2026-08-08T16:59:12.106060Z","title":"VLMAE: Vision-Language Masked Autoencoder","venue":"cs.CV","work_id":"d3833444-1ae8-4185-b487-a9a2572b8fbd","year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.946360Z"},"links":{"cited_paper":"/paper/2208.09374","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f7b69aacaa47e601960ce350ab58b10b7f1ef48140ab0753951a678374e1a274","observation_id":"7d534b61-812d-4bd6-8096-e1accd4878e1","resolution":{"observed_at":"2026-08-08T16:59:12.128574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.951037Z","title":"A compre- hensive study of image classification model sensitivity to foregrounds, backgrounds, and visual attributes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.951037Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7220577101fe40061914aab9585cafd853e6be1e854f24bd6458a7c9e6c3d97d","observation_id":"e90b8372-757a-4350-af5f-4898e7a6a024","resolution":{"observed_at":"2026-08-08T16:59:10.951037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.955330Z","title":"A challenging benchmark of anime style recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.955330Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:091ab84166bc12cda64cfa76de671fc96fa08292416f5b01e8189433411ee710","observation_id":"d0d4f501-0a2b-4007-83e3-1ccef1a65f85","resolution":{"observed_at":"2026-08-08T16:59:10.955330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.960419Z","title":"Metaformer is actually what you need for vision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.960419Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0664b9a36701245b8e8b4a31cb96516bf81fea8dba9831ed1e2786da17830f44","observation_id":"7ec2ad21-43de-4333-99d6-ba9ecface9a1","resolution":{"observed_at":"2026-08-08T16:59:10.960419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.965280Z","title":"Delving deep into the generalization of vision transformers under distribution shifts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.965280Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c74df2f94e2dfad70d05698ac1a07c2991bc9f2c8db01d80ee1aee3071b5319b","observation_id":"0869e2ca-474f-46aa-bf2b-667d754c1d32","resolution":{"observed_at":"2026-08-08T16:59:10.965280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.970138Z","title":"General facial representation learning in a visual- linguistic manner,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.970138Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c6ad383d27c123d5d8b1f867e6f5dc3bbb1c6f81e74ca1e9710e08a90d787302","observation_id":"3992634d-9567-458d-893d-75ca64e133cb","resolution":{"observed_at":"2026-08-08T16:59:10.970138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.974492Z","title":"Multi-modal alignment using representa- tion codebook,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.974492Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:a927042cc21dc5f0d42f0be453dc29dc9a9a53b265ec84d07fe137b9859e68a4","observation_id":"ce334212-4a11-43ec-bcb4-c49ea2364d55","resolution":{"observed_at":"2026-08-08T16:59:10.974492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.979504Z","title":"Plug-and-play VQA: Zero-shot VQA by conjoining large pretrained models with zero training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.979504Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7884f597dd409cea9894cf772794c1861c00d401eb2867cb97c3384f574cf0f9","observation_id":"136ae6d9-9f8c-473a-9a0c-572f10a23b29","resolution":{"observed_at":"2026-08-08T16:59:10.979504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.983594Z","title":"Inception transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.983594Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:fd7f905036efa31df05ab8fadb4d79f4f862e647f4cbb2f6366f7e477ff025ef","observation_id":"16f7963a-715b-4d2f-800a-927664864f8c","resolution":{"observed_at":"2026-08-08T16:59:10.983594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.988241Z","title":"Delving into sequential patches for deep- fake detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.988241Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8072bf314338ac5de40cc4443598d65a5bddb87caba14d4a1f7a2588d3ee0b4a","observation_id":"e6bb17c9-8e60-480f-b346-9f91e16eba1c","resolution":{"observed_at":"2026-08-08T16:59:10.988241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.992974Z","title":"Adversarial normalization: I can visualize everything (ice),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.992974Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:27188881593bca960e67d6dfc2019147c9bed14388f9950cf88ed0f8eb9230e4","observation_id":"221817f8-c088-4d15-a179-8aac556bfc75","resolution":{"observed_at":"2026-08-08T16:59:10.992974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.997910Z","title":"A new benchmark: On the utility of synthetic data with blender for bare supervised learning and downstream domain adaptation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.997910Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3e3b775a1cfba61b3da06fc577651f0f1cc13b7e880d17b9e809dfe5abc3b5c2","observation_id":"435411ee-05f4-4aa7-b21d-b796ff46f1e4","resolution":{"observed_at":"2026-08-08T16:59:10.997910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.002177Z","title":"Selfme: Self-supervised motion learning for micro- expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.002177Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:6d94e5b07804f4c106e874f694d8f4c8800dbe91b3bc846f0e991c411124f0fd","observation_id":"578198fe-54c4-47d8-8a41-bb65e2d10af6","resolution":{"observed_at":"2026-08-08T16:59:11.002177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.006873Z","title":"Marlin: Masked autoencoder for facial video representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.006873Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:5a8bd99744f596833542f051ccda9c86fe7b96eebc54f6463f1c175c53dbb7f3","observation_id":"2eb616b1-5ff8-4cde-9aa5-a6fcc5828b3b","resolution":{"observed_at":"2026-08-08T16:59:11.006873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.011351Z","title":"Blackvip: Black-box visual prompting for robust transfer learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.011351Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bd048146c9bf274975eea6e1cf9344072493357678facfccf7fdcf2b809379b9","observation_id":"00360c11-ac10-4e8c-a3e0-a892efc24898","resolution":{"observed_at":"2026-08-08T16:59:11.011351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.015441Z","title":"To- kenhpe: Learning orientation tokens for efficient head pose estimation via transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.015441Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c32055a39c7d5a73134fcf35f90d608a6721c60d4d775fc3740a3e96a0186be8","observation_id":"b51f83f7-e2d6-43a8-b78d-3ca76bfc2530","resolution":{"observed_at":"2026-08-08T16:59:11.015441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.019933Z","title":"Boost vision trans- former with gpu-friendly sparsity and quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.019933Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:75f366cb8d30e0c4d75433ce72f51258dce5fea4b0cc73ff0f263d1f639182e0","observation_id":"50068a82-55d8-46f2-befa-fd67dd965d89","resolution":{"observed_at":"2026-08-08T16:59:11.019933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.024488Z","title":"Vision diffmask: Faithful interpretation of vision transformers with differentiable patch masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.024488Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:08683f079593eae9d263304e3f2be822479cf92286d19db2b9f6c32f521c9c81","observation_id":"829603f1-bf1b-4491-b10e-32f38c1bceec","resolution":{"observed_at":"2026-08-08T16:59:11.024488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.029301Z","title":"Pha: Patch-wise high-frequency augmentation for transformer-based person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.029301Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:abd0b3b9cf3d29ce4276bb287296957a5f684c8ead136d18c4ddcf88da695072","observation_id":"f313bd3d-1844-4a9a-bd85-3d2672d52b36","resolution":{"observed_at":"2026-08-08T16:59:11.029301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.034092Z","title":"Vision trans- formers with mixed-resolution tokenization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.034092Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f0ba6e9d5a23ca43b20c339eeef9451e6645f826d3145a44e11fff3b47363e15","observation_id":"04a60b94-805b-4d54-98f9-74f3c0d9738b","resolution":{"observed_at":"2026-08-08T16:59:11.034092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.039180Z","title":"D3former: Debiased dual distilled transformer for incremental learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.039180Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7c281805aa10c467e4b531f3b676f955d8b96a9caa95ca081af5270d7038363d","observation_id":"bf297aea-97c5-4447-9571-90ed5b5de311","resolution":{"observed_at":"2026-08-08T16:59:11.039180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.043469Z","title":"Shared inter- est...sometimes: Understanding the alignment between human perception, vision architectures, and saliency map techniques,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.043469Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d5963ec0a58bb3ff4d5a0b497399799c38e29895a72b9da5244ad11f8f950821","observation_id":"6c8475f5-969f-4ffa-9351-3c69d53c8376","resolution":{"observed_at":"2026-08-08T16:59:11.043469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.047846Z","title":"Semicvt: Semi- supervised convolutional vision transformer for seman- tic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.047846Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:16dd8fc4f3d826d1bb1b3b0da70099965b9fb7596ab511202df353f3f4c4f579","observation_id":"55df5f88-0300-4922-b572-9723c58761fc","resolution":{"observed_at":"2026-08-08T16:59:11.047846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.052256Z","title":"Masked autoencoding does not help natural language supervision at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.052256Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:90f482737fdac0de7355220b8db85af1568d8112c71d25df3911b9c3eeb1a077","observation_id":"ceba726d-42b0-4a9d-8219-f66a38dffa55","resolution":{"observed_at":"2026-08-08T16:59:11.052256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.057254Z","title":"Vilem: Visual- language error modeling for image-text retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.057254Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:aea739cca7e27dd06caa1decd09c39440a5314ab9ea119867c78989c632078e8","observation_id":"c2bc21db-f7a6-4764-8f71-0d34ef5184d3","resolution":{"observed_at":"2026-08-08T16:59:11.057254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.061757Z","title":"Fashionsap: Symbols and attributes prompt for fine-grained fashion vision-language pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.061757Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:37b7c169c99cc44f53391eb33b3bfee43104f2a6b5586542e0ea44f2a2490db1","observation_id":"2da5988c-6dde-40e8-9825-d48802689472","resolution":{"observed_at":"2026-08-08T16:59:11.061757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.068004Z","title":"Zero-shot referring image segmentation with global-local context features,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.068004Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:62c42fee3fdcc201cb863db150463c0bac2f2f6fd2fac8d1bd68a6e3fe69b398","observation_id":"a62b514b-987f-4434-bd4f-ac0f10068217","resolution":{"observed_at":"2026-08-08T16:59:11.068004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.072944Z","title":"Improving visual grounding by encouraging consistent gradient-based explanations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.072944Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ce210dd536c1d3f428cd8cfd48c7a1a21fe5d4e0a07e6535dee1ccbfe3a1115e","observation_id":"c32fa6b7-ffff-4f1e-8ccc-54d1715fb53a","resolution":{"observed_at":"2026-08-08T16:59:11.072944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.077543Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.077543Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:fc943ff29accaa1b2dcd1329274e8e5bba9a91882e086c322c3a14e42e6ea014","observation_id":"7b42af4c-c1e8-401f-b212-beadef5ce0a3","resolution":{"observed_at":"2026-08-08T16:59:11.077543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.082156Z","title":"Multi-modal representation learn- ing with text-driven soft masks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.082156Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e2b0ca25c210a21ee71fd60d0672b32cbdcd6eceba052faff9d1f7533e763148","observation_id":"e73f4ac9-9245-4cf8-8ac6-abe073ded2e0","resolution":{"observed_at":"2026-08-08T16:59:11.082156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.086478Z","title":"From images to textual prompts: Zero-shot visual question answering with frozen large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.086478Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:34198b40b4d88c7c005d5dff74f73db4dcaac9f353894f3017b8f39120953da6","observation_id":"095db75f-298b-4a0f-98ad-8b46602f274c","resolution":{"observed_at":"2026-08-08T16:59:11.086478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.091386Z","title":"Sparse multi- modal vision transformer for weakly supervised seman- tic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.091386Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:268554200eb2068e0e4dacb859af12f5c4eef711d96f886218d50f77b8fefd10","observation_id":"5c5c3970-f154-4a40-aaf0-cbb4ac470c61","resolution":{"observed_at":"2026-08-08T16:59:11.091386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.095850Z","title":"Semantic information in contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.095850Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:414ae2ecd00d2e3e646a5565a338e366a8b3aa243798dc17a096cde6284e0b32","observation_id":"ee4af320-2763-4d38-ae43-a9043e532d59","resolution":{"observed_at":"2026-08-08T16:59:11.095850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.100616Z","title":"Smmix: Self-motivated image mixing for vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.100616Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:fd648d3a65e69f3fd58200e018278446807d66cbc87198727785cee62d61f349","observation_id":"fe2cf79a-731b-4777-9221-70e8dabcd219","resolution":{"observed_at":"2026-08-08T16:59:11.100616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.105981Z","title":"Cose: A consistency- sensitivity metric for saliency on image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.105981Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:371886f9476b9920b030bc30c18f055bc82f5797490aa030b54e21149609f9c8","observation_id":"0257e80a-6b6a-4220-a954-846725895a96","resolution":{"observed_at":"2026-08-08T16:59:11.105981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:10:25.594919Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":251},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 251 outbound references and 0 inbound Pith citation observations for arXiv:2608.05258."}