{"as_of":"2026-08-09T08:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e1b3b1ea7536b103db3b3edc3b86b5ccf1b40905a135eb0f10bcdec764ee5a7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:51:30.333740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:8fd063278346ebd892c5b6193dc274e2b8b00cc25cd007dfdf12f497dc4f9e0f","observation_id":"8cdf6adb-3f23-499d-9665-5035d9dbfeae","resolution":{"observed_at":"2026-05-13T06:24:49.863701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2409.10102","last_updated":"2026-05-16T07:15:07Z","snapshot_observed_at":"2026-08-04T19:12:49.508911Z","submitted_at":"2024-09-16T09:06:44Z","title":"Trustworthiness in Retrieval-Augmented Generation Systems: A Survey","version":2},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-05-23T21:08:11.787013Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2409.10102"},"observation_digest":"sha256:8c68d6d332742759f78c063fc0110cde5e9139283868db808b0a7e0ac4d07ca0","observation_id":"e0e50dfa-f366-4655-8246-e8603b0d36e2","resolution":{"observed_at":"2026-05-23T21:08:25.878110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-08T22:51:30.333740Z","title":"and Zuidema, W","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04320","last_updated":"2025-07-01T20:00:27Z","snapshot_observed_at":"2026-08-09T05:21:16.525940Z","submitted_at":"2025-02-06T18:59:00Z","title":"ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:51:30.333740Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2502.04320"},"observation_digest":"sha256:f04048268f0f4f1627d0b8b9d47ff9d824b5cc43df86febb13ecb348ea5d9e19","observation_id":"8c7919ed-079b-461e-8aa8-f182a905f229","resolution":{"observed_at":"2026-08-08T22:51:30.333740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-08T20:48:50.724239Z","title":"Quantifying atten- tion flow in transformers","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.04981","last_updated":"2025-08-02T11:08:33Z","snapshot_observed_at":"2026-08-08T20:41:48.070033Z","submitted_at":"2025-02-07T14:58:59Z","title":"AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T20:48:50.724239Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2502.04981"},"observation_digest":"sha256:c1cf11aa450846f68c1e315d36b1fe6957fda2342a8f80dc8f19b58bccb94900","observation_id":"0ebbbca7-d98b-4828-a18f-a5f9d9f62c76","resolution":{"observed_at":"2026-08-08T20:48:50.724239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2504.05454","last_updated":"2026-05-19T17:55:07Z","snapshot_observed_at":"2026-07-06T21:05:44.765030Z","submitted_at":"2025-04-07T19:42:12Z","title":"GraphPINE: Graph Importance Propagation for Interpretable Drug Response Prediction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T20:31:08.783930Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2504.05454"},"observation_digest":"sha256:5d4e532f10c18e16f5e7a277fca5d979a1b011e2f866600d0f82701b0b636abb","observation_id":"17bfe896-a768-47fe-8d9f-8ac878f9159e","resolution":{"observed_at":"2026-05-22T20:32:04.692013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-07T14:16:20.377706Z","title":"Quantifying attention flow in transformers.arXiv preprint arXiv:2005.00928, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19613","last_updated":"2025-09-11T08:58:20Z","snapshot_observed_at":"2026-08-09T03:28:35.794255Z","submitted_at":"2025-05-26T07:30:00Z","title":"TESSER: Transfer-Enhancing Adversarial Attacks from Vision Transformers via Spectral and Semantic Regularization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:20.377706Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2505.19613"},"observation_digest":"sha256:4feeb21d0f60f881bc1d7ebfecf8d7d61e669ad45df7e97e528b121d00f0f681","observation_id":"8674c74c-2692-43b9-9e95-f0908281cb3b","resolution":{"observed_at":"2026-08-07T14:16:20.377706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-07T04:25:14.764223Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.10669","last_updated":"2025-06-13T08:57:35Z","snapshot_observed_at":"2026-08-09T03:57:00.623349Z","submitted_at":"2025-06-12T12:58:43Z","title":"PiPViT: Patch-based Visual Interpretable Prototypes for Retinal Image Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:25:14.764223Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2506.10669"},"observation_digest":"sha256:da1d8eca927234eb6ca8c181e65ad466114ed631e14223e1c26f81009be81454","observation_id":"f734de23-a2c2-4c48-93d0-27f5f9171264","resolution":{"observed_at":"2026-08-07T04:25:14.764223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T18:18:00.282184Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08912","last_updated":"2025-07-11T15:17:02Z","snapshot_observed_at":"2026-08-06T18:11:15.411027Z","submitted_at":"2025-07-11T15:17:02Z","title":"Fair-FLIP: Fair Deepfake Detection with Fairness-Oriented Final Layer Input Prioritising","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:00.282184Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.08912"},"observation_digest":"sha256:87d3075af19137b1a0463d7fca321d99f14771bfe754139ea2fc04e50a215193","observation_id":"5a93fd9e-8533-45a2-a271-1af7751eec61","resolution":{"observed_at":"2026-08-06T18:18:00.282184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T18:16:31.806132Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-09T05:23:12.933526Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:31.806132Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:2bb178bedb39af35941b542c93bcd736accab6306a9fa8f3d4150eda84b56adc","observation_id":"c726c330-bfe5-4691-807a-92c4078ef2cf","resolution":{"observed_at":"2026-08-06T18:16:31.806132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T16:51:52.209435Z","title":"arXiv preprint arXiv:2005.00928 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12464","last_updated":"2025-07-16T17:59:32Z","snapshot_observed_at":"2026-08-07T18:12:41.445155Z","submitted_at":"2025-07-16T17:59:32Z","title":"CytoSAE: Interpretable Cell Embeddings for Hematology","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:52.209435Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.12464"},"observation_digest":"sha256:2bc1cd071013ae86bce2b002a29aa6f3c95bf51c03d059697d5b17f986d49ffa","observation_id":"742c8be5-1163-49cd-8f1a-77687eb14bb4","resolution":{"observed_at":"2026-08-06T16:51:52.209435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T14:13:52.013407Z","title":"Abnar and W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.19773","last_updated":"2025-07-26T03:48:12Z","snapshot_observed_at":"2026-08-06T14:13:50.014323Z","submitted_at":"2025-07-26T03:48:12Z","title":"Self-Guided Masked Autoencoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:13:52.013407Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.19773"},"observation_digest":"sha256:4ce910070862b07417d55ddad60ff65afa07ad48b53aa60c193d93bbd18a899e","observation_id":"ce5e59b4-c102-4b92-a90c-313177188c0b","resolution":{"observed_at":"2026-08-06T14:13:52.013407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T13:09:48.198270Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.21205","last_updated":"2025-07-28T17:54:15Z","snapshot_observed_at":"2026-08-08T14:13:58.665193Z","submitted_at":"2025-07-28T17:54:15Z","title":"Learning from Limited and Imperfect Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:09:48.198270Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.21205"},"observation_digest":"sha256:4044f63ea5b1877c613e8565386f6dee9efea12ded2b1d259391a7680ce578bf","observation_id":"83f2a644-b095-4893-a360-d15ca788a86b","resolution":{"observed_at":"2026-08-06T13:09:48.198270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T12:28:40.429191Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21799","last_updated":"2026-07-31T06:39:38Z","snapshot_observed_at":"2026-08-06T14:01:37.240648Z","submitted_at":"2025-07-29T13:35:51Z","title":"Towards White-Box Deep Wireless Sensing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:28:40.429191Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.21799"},"observation_digest":"sha256:193ae5ac99f29d1f08ee5755370e294ba0a23ede8b5f2010be81794e9883847e","observation_id":"ce68e053-2c55-46b5-8982-b395b474b0df","resolution":{"observed_at":"2026-08-06T12:28:40.429191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T10:41:27.031476Z","title":"Quantifying attention flow in transform- ers,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.23544","last_updated":"2025-07-31T13:34:15Z","snapshot_observed_at":"2026-08-06T10:41:26.342913Z","submitted_at":"2025-07-31T13:34:15Z","title":"User Experience Estimation in Human-Robot Interaction Via Multi-Instance Learning of Multimodal Social Signals","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:41:27.031476Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2507.23544"},"observation_digest":"sha256:80546994cd1529a977884b10a174dc212b29372220a07d4422a3b5db49b7179e","observation_id":"1850da1b-af9b-4c34-abde-0d40da4c2f75","resolution":{"observed_at":"2026-08-06T10:41:27.031476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-09T05:23:29.071990Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T00:34:38.247099Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:81f84ef6288a3393749dbc092bfbf2fd0d51099d7b1bb15ea6e99dee974ec5b5","observation_id":"b12bd536-3b2d-4159-8daa-fa518836909a","resolution":{"observed_at":"2026-05-19T00:36:56.262629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-06T00:02:58.605909Z","title":"Abnar, W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-09T05:23:29.071990Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:02:58.605909Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:f6d99d8804aa3e7d5fd7d7637034528c6fa8fd57b32db30cdc682c324cd04433","observation_id":"049a9238-c45e-43bc-a367-b3bee50d3a95","resolution":{"observed_at":"2026-08-06T00:02:58.605909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-05T20:54:39.639434Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.09785","last_updated":"2025-08-13T13:10:18Z","snapshot_observed_at":"2026-08-07T03:06:33.941606Z","submitted_at":"2025-08-13T13:10:18Z","title":"DSS-Prompt: Dynamic-Static Synergistic Prompting for Few-Shot Class-Incremental Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:54:39.639434Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.09785"},"observation_digest":"sha256:bfc344639cceb3f36e275a5db9f8811f9930111363e3008e77a84b8ed420b727","observation_id":"2854709d-b58b-4bc0-a3b7-b692fc08a9f4","resolution":{"observed_at":"2026-08-05T20:54:39.639434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-05T20:19:02.105165Z","title":"Abnar and W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.10840","last_updated":"2025-08-14T17:06:50Z","snapshot_observed_at":"2026-08-08T10:54:48.141750Z","submitted_at":"2025-08-14T17:06:50Z","title":"Generalizable Federated Learning using Client Adaptive Focal Modulation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:19:02.105165Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.10840"},"observation_digest":"sha256:a63fc1a6adef5d2a7fd2feffecef77d0399000e0c6ca87dc4615b34ae4269e35","observation_id":"7eb3a107-96c1-4951-881f-f8b38204efee","resolution":{"observed_at":"2026-08-05T20:19:02.105165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-05T14:54:13.797142Z","title":"arXiv preprint arXiv:2005.00928 (2020)","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.20776","last_updated":"2025-08-28T13:32:35Z","snapshot_observed_at":"2026-08-05T14:54:13.213015Z","submitted_at":"2025-08-28T13:32:35Z","title":"Safer Skin Lesion Classification with Global Class Activation Probability Map Evaluation and SafeML","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:13.797142Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.20776"},"observation_digest":"sha256:694235d6d05c7bb926206d766de90a3299ce3ad6fd76e1f1e4360baeb2f8a681","observation_id":"45f6f04e-d8da-4e59-845b-883a9289e622","resolution":{"observed_at":"2026-08-05T14:54:13.797142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-05T14:30:47.431443Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.21243","last_updated":"2025-08-28T22:13:20Z","snapshot_observed_at":"2026-08-07T22:19:04.688808Z","submitted_at":"2025-08-28T22:13:20Z","title":"Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:30:47.431443Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2508.21243"},"observation_digest":"sha256:f8965dabc8b99b134dcf676215716880f34c50bceafde6c19abaa26195652eb6","observation_id":"4a7308f7-d8fd-408b-a6cf-d3385c780575","resolution":{"observed_at":"2026-08-05T14:30:47.431443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-05T13:27:41.270338Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.05323","last_updated":"2025-09-09T12:40:17Z","snapshot_observed_at":"2026-08-08T23:24:28.005005Z","submitted_at":"2025-08-30T19:46:18Z","title":"Attention of a Kiss: Exploring Attention Maps in Video Diffusion for XAIxArts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:27:41.270338Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2509.05323"},"observation_digest":"sha256:fa0ce92816817f6ca6033c4b5e8267336db7f04e73340c857d6402e43bf361de","observation_id":"a28b874c-2f21-4d49-a693-efe2059173c6","resolution":{"observed_at":"2026-08-05T13:27:41.270338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-04T22:00:20.244932Z","title":"arXiv preprint arXiv:2005.00928 (2020)","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.07581","last_updated":"2025-09-09T10:44:25Z","snapshot_observed_at":"2026-08-04T22:00:18.726151Z","submitted_at":"2025-09-09T10:44:25Z","title":"Attention Maps in 3D Shape Classification for Dental Stage Estimation with Class Node Graph Attention Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:00:20.244932Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2509.07581"},"observation_digest":"sha256:e00a6659d753cf7d9b76119f1f9500e1f0acb612d8ba9b6a1203b0a52e9a6fb6","observation_id":"8617419a-d45a-4b77-a266-365b10467542","resolution":{"observed_at":"2026-08-04T22:00:20.244932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-04T18:33:09.228542Z","title":"& Lee, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09911","last_updated":"2025-09-12T00:54:07Z","snapshot_observed_at":"2026-08-07T18:30:54.637739Z","submitted_at":"2025-09-12T00:54:07Z","title":"An Autoencoder and Vision Transformer-based Interpretability Analysis of the Differences in Automated Staging of Second and Third Molars","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T18:33:09.228542Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2509.09911"},"observation_digest":"sha256:a9625d0baa3b377394c5c4cbdaaa4c8bf302a470fb92068f6613315eda5d5761","observation_id":"9bc1ead4-5206-4132-b382-47ce173412d1","resolution":{"observed_at":"2026-08-04T18:33:09.228542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-03T16:36:31.449917Z","title":"Quantifying atten- tion flow in transformers.arXiv preprint arXiv:2005.00928,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.12887","last_updated":"2026-05-26T20:05:22Z","snapshot_observed_at":"2026-08-08T13:45:57.936202Z","submitted_at":"2025-12-15T00:01:19Z","title":"Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:36:31.449917Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2512.12887"},"observation_digest":"sha256:cfb915d906a44660256868101cea28bd75f9fd5980e9a19a11de4e1e73f2c6e5","observation_id":"851662fb-b912-41b3-9720-4eaed3a07fb1","resolution":{"observed_at":"2026-08-03T16:36:31.449917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-03T04:59:14.527871Z","title":"Abnar and W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.03531","last_updated":"2026-06-19T03:46:09Z","snapshot_observed_at":"2026-08-06T01:28:51.088554Z","submitted_at":"2026-02-03T13:48:34Z","title":"Robust Representation Learning in Masked Autoencoders","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:59:14.527871Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2602.03531"},"observation_digest":"sha256:ca02bd97bb9efa60036a02ff3ee32203f461128236313a75cce530372b8d5a7f","observation_id":"de3a762a-f2c3-4df9-9c55-292fd0d3c534","resolution":{"observed_at":"2026-08-03T04:59:14.527871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-03T03:50:14.398759Z","title":"arXiv preprint arXiv:2005.00928 (2020)","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.06841","last_updated":"2026-05-31T17:09:07Z","snapshot_observed_at":"2026-08-09T07:23:34.031341Z","submitted_at":"2026-02-06T16:34:29Z","title":"From Features to Actions: Explainability in Traditional and Agentic AI Systems","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:14.398759Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2602.06841"},"observation_digest":"sha256:51bbed4d6ce8290f149704c27af8eb2646648d509a3b4051e8407e0144211fc9","observation_id":"874b44e1-7fbf-46dc-b661-b214b2556cd4","resolution":{"observed_at":"2026-08-03T03:50:14.398759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2602.16608","last_updated":"2026-05-19T23:05:11Z","snapshot_observed_at":"2026-08-08T15:26:08.027438Z","submitted_at":"2026-02-18T17:03:10Z","title":"Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T12:46:59.419162Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2602.16608"},"observation_digest":"sha256:eb44bc71f572e3a98746feb1f96ea739bbd39f41ce5ae594501efab13a57cac2","observation_id":"8641f078-cdd2-446a-931f-a535ebda65b8","resolution":{"observed_at":"2026-05-21T12:50:09.294556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-02T18:55:18.489930Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.13326","last_updated":"2026-06-28T21:30:24Z","snapshot_observed_at":"2026-08-07T13:22:06.457741Z","submitted_at":"2026-03-04T18:24:31Z","title":"Feature-level Interaction Explanations in Multimodal Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:55:18.489930Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2603.13326"},"observation_digest":"sha256:11960a03e7e3fc285bd40394771c96b59657818f96904daf8ccd4172bcf96e42","observation_id":"f8672565-f836-4027-b530-b4d0209bf1fd","resolution":{"observed_at":"2026-08-02T18:55:18.489930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2604.13258","last_updated":"2026-04-14T19:43:43Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T19:43:43Z","title":"Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T15:23:53.906870Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2604.13258"},"observation_digest":"sha256:ef0c962f0fc666c1fbd1501d5b1ff42b8f32a317f0df4e4996baf0bb328431c7","observation_id":"78fa4814-e139-4a81-ab65-cfbff1572fd2","resolution":{"observed_at":"2026-05-11T10:41:01.986433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2604.16485","last_updated":"2026-04-13T04:32:24Z","snapshot_observed_at":"2026-08-06T15:37:08.760503Z","submitted_at":"2026-04-13T04:32:24Z","title":"Saccade Attention Networks: Using Transfer Learning of Attention to Reduce Network Sizes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:55.861097Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2604.16485"},"observation_digest":"sha256:3bfbd9fd876e29fb21d6f4d51ca36615f02c58423b3bf121c4f6754b2927a07b","observation_id":"db9aa949-4c6c-4fd9-988a-530f4094b6db","resolution":{"observed_at":"2026-05-10T15:50:34.205622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.02707","last_updated":"2026-05-04T15:13:47Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:13:47Z","title":"SAIL: Structure-Aware Interpretable Learning for Anatomy-Aligned Post-hoc Explanations in OCT","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:35.927272Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.02707"},"observation_digest":"sha256:0c84e1d1f6bf9b0ec46d39bca4dd16b5ddfdab2d6960366709b83a2085175d0d","observation_id":"0c312f64-b47f-42d0-87d0-982cca4e9c10","resolution":{"observed_at":"2026-05-09T06:35:41.068620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.09271","last_updated":"2026-05-10T02:42:29Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T02:42:29Z","title":"Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:38.118237Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.09271"},"observation_digest":"sha256:2b4cb235cc2bf39aadd9ebd60a4ac0a8ca02cd91b2d5bbf2f44a34509dd545ca","observation_id":"7b9bd0db-0a56-41b1-8a1a-8e09cf1f666b","resolution":{"observed_at":"2026-05-12T05:41:27.368672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.11885","last_updated":"2026-05-12T09:59:14Z","snapshot_observed_at":"2026-08-02T05:51:56.792043Z","submitted_at":"2026-05-12T09:59:14Z","title":"From Clever Hans to Scientific Discovery: Interpreting EEG Foundational Transformers with LRP","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T06:23:59.510140Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.11885"},"observation_digest":"sha256:e2e7c0959a3fc0b98e9828fd4a20e6c9254a059585d23dd2c6e4672b70478308","observation_id":"4ca1d0af-a91e-4aba-910a-c28bbc1be9ce","resolution":{"observed_at":"2026-05-13T06:27:24.076632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:40:36.771439Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:ed0556208bd0f08a4ea9c47ada7bc4ad30f17c6c07a9405a85b48236f33c3f56","observation_id":"fa9c52a8-f794-45d1-8f28-d6e9b00743dd","resolution":{"observed_at":"2026-05-15T02:49:41.685898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T21:02:52.559284Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:4fa33a4c95d17f65e65f7803947c636b1513f062a47c70918174caf4c1e2e8d5","observation_id":"55432e1d-3f55-437e-a5a5-6b50e38beb58","resolution":{"observed_at":"2026-05-20T21:03:46.357618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T21:37:34.236270Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:95c9d42d0ee8777d453b5064a41867b7feefe8f64c5db4893159f04c684e9845","observation_id":"b35bd84e-d748-43a1-921b-a6e618189432","resolution":{"observed_at":"2026-07-01T14:25:46.311770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.18681","last_updated":"2026-05-18T17:21:48Z","snapshot_observed_at":"2026-08-07T03:42:32.970501Z","submitted_at":"2026-05-18T17:21:48Z","title":"Learning Quantifiable Visual Explanations Without Ground-Truth","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-20T10:11:48.674949Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.18681"},"observation_digest":"sha256:6cb02acd621accfe78e398998b4ce0d3956ff10da357bd16b4b1e0625169147e","observation_id":"cc11027b-bc00-4d8e-9620-ed5fbf13c7c5","resolution":{"observed_at":"2026-05-20T10:13:11.877988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.26190","last_updated":"2026-05-25T09:22:11Z","snapshot_observed_at":"2026-08-08T23:31:26.372940Z","submitted_at":"2026-05-25T09:22:11Z","title":"HRVConformer: Neonatal Hypoxic-Ischemic Encephalopathy Classification from the Heart Rate signals","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:05.250308Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.26190"},"observation_digest":"sha256:681bc396d98ce1f17734fabab4496816a05b2168a35610322615309250356a31","observation_id":"dbd9e45b-da10-487e-8eb7-5750d8121450","resolution":{"observed_at":"2026-06-30T00:14:04.678558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2605.26460","last_updated":"2026-05-26T02:17:29Z","snapshot_observed_at":"2026-08-08T16:07:50.155297Z","submitted_at":"2026-05-26T02:17:29Z","title":"AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T18:48:47.286752Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2605.26460"},"observation_digest":"sha256:82dcda6c4cc19086ff58b149fd7ce2054a0389caba3634d54ca2fc4f5cafe828","observation_id":"ce54d5ba-5864-42a2-a73e-22d7cb7e8f00","resolution":{"observed_at":"2026-06-29T18:53:51.475203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2606.03569","last_updated":"2026-06-02T12:36:24Z","snapshot_observed_at":"2026-08-02T13:19:20.535572Z","submitted_at":"2026-06-02T12:36:24Z","title":"When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:51:38.455604Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2606.03569"},"observation_digest":"sha256:51faf1f2f637f9c3bb464da3ebf6bf046737e12a039cd7c84e8bc0ef97b43a47","observation_id":"8efe30e9-e9f5-4da4-a91e-1c8fc90e6a51","resolution":{"observed_at":"2026-07-02T02:36:26.493965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:ddfc34457c42c0a50f617a8ab571c73300520118abf1ae7c1dd59429d919ace2","observation_id":"1d87175d-9e5c-4bf4-97ec-09d4afc110f4","resolution":{"observed_at":"2026-06-28T23:32:46.521352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":"2005.00928","doi":"10.48550/arxiv.2005.00928","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"b1dfb849-5689-41bc-9ea4-6fc13ddb3690","year":2020},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:96391815e316fb1aafedcac23a600604c66938093d16a1573ff397efbcb24229","observation_id":"9029c408-7c15-4afa-9d75-a55fabd7e1f3","resolution":{"observed_at":"2026-07-04T11:09:46.361747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-02T10:27:16.378943Z","title":"Quantifying Attention Flow in Transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:16.378943Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:17c4e4fead6ef10b2923795487b56344939d8e3087dac75ddde02cbd16d9fa9b","observation_id":"d2ef224f-3a4d-47bd-9368-4cf8b00182ec","resolution":{"observed_at":"2026-08-02T10:27:16.378943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-13T04:11:56.715045Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09279","last_updated":"2026-07-10T10:48:14Z","snapshot_observed_at":"2026-08-08T23:01:31.641498Z","submitted_at":"2026-07-10T10:48:14Z","title":"Transient Reserves, Sink Dampers, and the Failure of Eigenvalue Reasoning in the Attention Propagator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T04:11:56.715045Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2607.09279"},"observation_digest":"sha256:3e6496e3a19a141a6fa99dccc502f205ad8e5f8a41efe8e06249456dafc7e92d","observation_id":"8228fb96-aa3f-4a15-90c6-c8fd82a3b71b","resolution":{"observed_at":"2026-07-13T04:11:56.715045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-07-13T02:43:47.779443Z","title":"Abnar, W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.09480","last_updated":"2026-07-10T14:53:16Z","snapshot_observed_at":"2026-08-07T10:47:14.840762Z","submitted_at":"2026-07-10T14:53:16Z","title":"Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T02:43:47.779443Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2607.09480"},"observation_digest":"sha256:7b24665956153334c5bca3a2abf0efa955c4fb61d20a82c140572c809d30c529","observation_id":"7cf9b3bf-10ff-4972-aa37-fa6ecbdb7da7","resolution":{"observed_at":"2026-07-13T02:43:47.779443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-01T12:16:46.542816Z","title":"arXiv e-prints , keywords =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.19640","last_updated":"2026-07-22T00:21:36Z","snapshot_observed_at":"2026-08-04T21:04:08.236868Z","submitted_at":"2026-07-22T00:21:36Z","title":"AGNFormer I: Reconstruction of AGN spectra using a probabilistic transformer model","version":1},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-08-01T12:16:46.542816Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2607.19640"},"observation_digest":"sha256:dd54ffadb08983db5da9de607e0d0416065b2c5f3680c563a28a9d10ea2e28b1","observation_id":"f9338660-a8c5-447a-83f7-40168d8b0e1e","resolution":{"observed_at":"2026-08-01T12:16:46.542816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2005.00928/citation-record","integrity":"/paper/2005.00928/integrity","json":"/paper/2005.00928/citation-record.json","paper":"/paper/2005.00928"},"outbound":[],"paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T09:17:07.789326Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2005.00928."}