{"as_of":"2026-08-15T18:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0265e65c12f06f3d4cfb230a7275359e42245108b11f79fa98f9240f32e61140","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:37:14.547591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.476599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-12T21:37:14.547591Z","title":"Visual transformers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.08936","last_updated":"2024-11-13T11:25:05Z","snapshot_observed_at":"2026-08-13T17:00:46.835614Z","submitted_at":"2024-11-13T11:25:05Z","title":"Clustered Patch Embeddings for Permutation-Invariant Classification of Whole Slide Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:37:14.547591Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2411.08936"},"observation_digest":"sha256:12fef3e8e760dc60cc78a9942bd591e9136a0edeb71a1a80cf0395be78c06268","observation_id":"cccd1c63-7399-4300-8963-5eab62fb8407","resolution":{"observed_at":"2026-08-12T21:37:14.547591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-12T17:28:06.493438Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12558","last_updated":"2025-06-26T14:33:44Z","snapshot_observed_at":"2026-08-12T17:20:37.773842Z","submitted_at":"2024-11-19T15:18:50Z","title":"Recall and Refine: A Simple but Effective Source-free Open-set Domain Adaptation Framework","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T17:28:06.493438Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2411.12558"},"observation_digest":"sha256:11616d53b5376a4d53f2eacd7704ebfa7838f444023221f5dafaa1053464ea7e","observation_id":"8a59969b-d227-4ad9-819f-4bd529fe7755","resolution":{"observed_at":"2026-08-12T17:28:06.493438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-12T14:43:52.602676Z","title":"Visual transformers: Token- based image representation and processing for computer vi- sion,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.14975","last_updated":"2024-11-22T14:34:04Z","snapshot_observed_at":"2026-08-12T14:37:25.311623Z","submitted_at":"2024-11-22T14:34:04Z","title":"Exploring Foundation Models Fine-Tuning for Cytology Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:43:52.602676Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2411.14975"},"observation_digest":"sha256:58b0fb957d6d6026e446f79b3ccb8c705356c828430a349f1a7e9afb10f83d62","observation_id":"b21399bc-3865-4602-bfea-d21591e0cf01","resolution":{"observed_at":"2026-08-12T14:43:52.602676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-12T05:59:46.284846Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19731","last_updated":"2024-11-29T14:24:33Z","snapshot_observed_at":"2026-08-15T17:41:37.029234Z","submitted_at":"2024-11-29T14:24:33Z","title":"Real-Time Anomaly Detection in Video Streams","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T05:59:46.284846Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2411.19731"},"observation_digest":"sha256:df388838577f95c35b77d8f5d2b3d8c7a1ee17e8a902e0e97f6fea374345ce38","observation_id":"10c16e01-2d67-488d-89b5-6743e927b96f","resolution":{"observed_at":"2026-08-12T05:59:46.284846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-12T05:03:20.700980Z","title":"Visual transformers: Token-based image represen- tation and processing for computer vision,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00787","last_updated":"2024-12-01T12:21:23Z","snapshot_observed_at":"2026-08-13T21:18:25.887264Z","submitted_at":"2024-12-01T12:21:23Z","title":"TSUBF-Net: Trans-Spatial UNet-like Network with Bi-direction Fusion for Segmentation of Adenoid Hypertrophy in CT","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:03:20.700980Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2412.00787"},"observation_digest":"sha256:04b00c1c9c4c8f3354a8e6ff572b39fa037e0c97d65ea2745245fb532d578585","observation_id":"f0b79e23-c841-4b99-ab04-62b89f3e730d","resolution":{"observed_at":"2026-08-12T05:03:20.700980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-11T21:53:55.887844Z","title":"Visual transformers: Token- based image representation and processing for computer vision,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.04026","last_updated":"2024-12-15T03:43:06Z","snapshot_observed_at":"2026-08-11T21:48:26.389308Z","submitted_at":"2024-12-05T10:00:58Z","title":"M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:55.887844Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2412.04026"},"observation_digest":"sha256:bc4dc1d67a0482b361e85c1b884ea4778330cd6ee0c9904f74c0403ba7b15f7b","observation_id":"2fd49c31-be75-4af4-84ec-3e9a8d5c17d2","resolution":{"observed_at":"2026-08-11T21:53:55.887844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-10T22:27:56.320519Z","title":"Visual transformers: Token- based image representation and processing for computer vision,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01648","last_updated":"2025-01-03T05:37:54Z","snapshot_observed_at":"2026-08-10T22:20:54.489311Z","submitted_at":"2025-01-03T05:37:54Z","title":"Dual Mutual Learning Network with Global-local Awareness for RGB-D Salient Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:56.320519Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2501.01648"},"observation_digest":"sha256:41ea79441d033b62afd0ccd566c0aecaafefcb953d1f10520a23febdf8371abf","observation_id":"6d7442f7-77be-4bfe-8f4b-23ddc09882af","resolution":{"observed_at":"2026-08-10T22:27:56.320519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-10T21:47:26.640556Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03936","last_updated":"2025-02-21T07:52:39Z","snapshot_observed_at":"2026-08-10T21:41:33.930879Z","submitted_at":"2025-01-07T16:53:01Z","title":"PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:47:26.640556Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2501.03936"},"observation_digest":"sha256:85a838babf5937a35d8e16d8ed11c5716211908baad57ced962e2f61b1fb361a","observation_id":"f85bf048-364a-4f71-931e-2948d57ccca3","resolution":{"observed_at":"2026-08-10T21:47:26.640556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-10T20:25:59.538557Z","title":"Visual transformers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.08659","last_updated":"2025-04-30T01:36:04Z","snapshot_observed_at":"2026-08-12T22:42:55.031708Z","submitted_at":"2025-01-15T08:50:52Z","title":"BRIGHT-VO: Brightness-Guided Hybrid Transformer for Visual Odometry with Multi-modality Refinement Module","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:25:59.538557Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2501.08659"},"observation_digest":"sha256:525d56334d72b87838332d4dc9b8590a1d21ff0413b91b0952c9c6b3ae267a1d","observation_id":"36094c41-ccbc-43f4-8e2f-5ecdca2e55ac","resolution":{"observed_at":"2026-08-10T20:25:59.538557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-09T17:53:24.593745Z","title":"Visual transform- ers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.00752","last_updated":"2025-02-02T11:18:05Z","snapshot_observed_at":"2026-08-13T05:55:34.011187Z","submitted_at":"2025-02-02T11:18:05Z","title":"Zero-Shot Warning Generation for Misinformative Multimodal Content","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T17:53:24.593745Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2502.00752"},"observation_digest":"sha256:af61581683390aec187a1166de6284d2ccc8ad7fd59893d46e44a65e8c7c4765","observation_id":"abb19d1f-e528-4406-97a0-69ecaa6e1b87","resolution":{"observed_at":"2026-08-09T17:53:24.593745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-08T18:08:52.485744Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05756","last_updated":"2025-02-09T03:24:03Z","snapshot_observed_at":"2026-08-15T10:50:28.475542Z","submitted_at":"2025-02-09T03:24:03Z","title":"Exploring Visual Embedding Spaces Induced by Vision Transformers for Online Auto Parts Marketplaces","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T18:08:52.485744Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2502.05756"},"observation_digest":"sha256:df052726f7eaee88b0f8381b152d2883e29fa22a4f0f6d125b3f9d3932b72461","observation_id":"c9bc989c-6939-4250-b889-573ef6789267","resolution":{"observed_at":"2026-08-08T18:08:52.485744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2504.05902","last_updated":"2026-04-13T15:36:03Z","snapshot_observed_at":"2026-07-06T21:06:03.653624Z","submitted_at":"2025-04-08T11:01:07Z","title":"Defending against Backdoor Attacks via Module Switching","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T20:28:24.169272Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2504.05902"},"observation_digest":"sha256:7bf5d997dfcc58ea9dc3e753d6ae5d65566fa0ecca424234551e2f2061fb5c02","observation_id":"6577d602-f489-4662-b633-ea4472b74b5f","resolution":{"observed_at":"2026-05-22T20:32:04.763637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-07T11:22:59.772724Z","title":"arXiv preprint arXiv:2006.03677 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05383","last_updated":"2025-06-03T09:03:27Z","snapshot_observed_at":"2026-08-10T19:10:06.664961Z","submitted_at":"2025-06-03T09:03:27Z","title":"Can Vision Transformers with ResNet's Global Features Fairly Authenticate Demographic Faces?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:59.772724Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2506.05383"},"observation_digest":"sha256:97673992eea58abcc02ca4c82a569a6e6b25493a1c3fbebad282de9fc33aa5ca","observation_id":"e34d4855-55ad-4fd9-b450-aebd848e2419","resolution":{"observed_at":"2026-08-07T11:22:59.772724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-07T00:55:35.034653Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12363","last_updated":"2025-06-14T05:53:54Z","snapshot_observed_at":"2026-08-08T20:37:17.562764Z","submitted_at":"2025-06-14T05:53:54Z","title":"Hierarchical Deep Feature Fusion and Ensemble Learning for Enhanced Brain Tumor MRI Classification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:55:35.034653Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2506.12363"},"observation_digest":"sha256:35ad6cdc2dff652a6a0c4b34e10d4223974505e6567f355c445069c5fd290e61","observation_id":"b99e02f5-99a0-4e77-a5c0-064d61fb9abf","resolution":{"observed_at":"2026-08-07T00:55:35.034653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-06T16:55:33.510651Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12177","last_updated":"2025-07-16T12:22:11Z","snapshot_observed_at":"2026-08-14T15:22:17.027379Z","submitted_at":"2025-07-16T12:22:11Z","title":"Hybrid Ensemble Approaches: Optimal Deep Feature Fusion and Hyperparameter-Tuned Classifier Ensembling for Enhanced Brain Tumor Classification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:33.510651Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2507.12177"},"observation_digest":"sha256:992263d86cdf156e0aed4d1754cf9d3a36f7efcd93ebd4c501b73bf8be5acaef","observation_id":"4c5aeb60-c08f-4187-af7a-0ab4da22106d","resolution":{"observed_at":"2026-08-06T16:55:33.510651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-06T14:36:21.395406Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.18550","last_updated":"2025-07-24T16:18:46Z","snapshot_observed_at":"2026-08-14T18:42:51.121274Z","submitted_at":"2025-07-24T16:18:46Z","title":"On the Performance of Concept Probing: The Influence of the Data (Extended Version)","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:21.395406Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2507.18550"},"observation_digest":"sha256:1ccb3c0f5636765c875b8f9187cac8964b1532f2e2099d2d22599cb08bf719bb","observation_id":"384dad4f-8e88-4557-ab0b-b3e25bf0b2e5","resolution":{"observed_at":"2026-08-06T14:36:21.395406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-06T12:39:41.651354Z","title":"Visual transformers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-15T02:37:54.127209Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:41.651354Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:bbaab471830e5891305b82e83d5a43a5d75b3e0285e6252a6edda83baf55de1b","observation_id":"e306f25c-a077-4e99-91eb-7661ce9e69f1","resolution":{"observed_at":"2026-08-06T12:39:41.651354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-05T20:42:26.151279Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10243","last_updated":"2025-08-14T00:13:22Z","snapshot_observed_at":"2026-08-13T18:17:34.594024Z","submitted_at":"2025-08-14T00:13:22Z","title":"Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:42:26.151279Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2508.10243"},"observation_digest":"sha256:a42b57e1209e0bd683db89c6867f56ffd447e940601e58375755d36aef46072d","observation_id":"3a97b8a1-aea6-48be-ae4e-aec3f4f4c7dd","resolution":{"observed_at":"2026-08-05T20:42:26.151279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-05T20:29:43.996459Z","title":"Visual Transform- ers: Token-based Image Representation and Processing for Computer Vision, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10490","last_updated":"2025-08-14T09:49:07Z","snapshot_observed_at":"2026-08-14T19:09:40.582805Z","submitted_at":"2025-08-14T09:49:07Z","title":"On the Complexity-Faithfulness Trade-off of Gradient-Based Explanations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:29:43.996459Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2508.10490"},"observation_digest":"sha256:903c6c2101f72809ee851f198f72a44fa7ace7939b431a5711827a23d3d42b36","observation_id":"babc0f36-4720-4574-bf17-7d6a1ba7dd3b","resolution":{"observed_at":"2026-08-05T20:29:43.996459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-05T10:40:00.899017Z","title":"Visual transformers: Token- based image representation and processing for computer vision,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.03872","last_updated":"2025-09-04T04:18:46Z","snapshot_observed_at":"2026-08-12T19:55:04.856026Z","submitted_at":"2025-09-04T04:18:46Z","title":"Focus Through Motion: RGB-Event Collaborative Token Sparsification for Efficient Object Detection","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T10:40:00.899017Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2509.03872"},"observation_digest":"sha256:be943e11a5718956c3e8c4c462d3ca8a3c642c2d0c25cd14d24fe86349022666","observation_id":"838fa267-a067-487e-889a-15b41a2cd9a2","resolution":{"observed_at":"2026-08-05T10:40:00.899017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-03T17:02:40.945788Z","title":"Visual transformers: Token-based image representation and processing for computer vision.arXiv preprint arXiv:2006.03677, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.10958","last_updated":"2026-06-01T17:54:44Z","snapshot_observed_at":"2026-08-13T02:06:13.721301Z","submitted_at":"2025-12-11T18:59:58Z","title":"WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-03T17:02:40.945788Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2512.10958"},"observation_digest":"sha256:2e56ac04356a430f4e9f0b90c8d3648ec04a9393232476ad9a7caeb78cdeaefd","observation_id":"3b8d841e-b0ad-4195-8b38-0b4617977183","resolution":{"observed_at":"2026-08-03T17:02:40.945788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2602.23061","last_updated":"2026-04-14T04:49:27Z","snapshot_observed_at":"2026-08-14T07:47:00.136255Z","submitted_at":"2026-02-26T14:48:49Z","title":"MoDora: Tree-Based Semi-Structured Document Analysis System","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T19:09:41.482713Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2602.23061"},"observation_digest":"sha256:2f1dc55dbd3fdd1681d73e57ddde9ecce09be8754e4f083c50d815624b9b65a7","observation_id":"a3c569f9-f741-41f5-ad29-97d634cdb446","resolution":{"observed_at":"2026-05-15T19:10:15.528788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2604.20276","last_updated":"2026-04-22T07:24:53Z","snapshot_observed_at":"2026-08-14T01:04:53.622863Z","submitted_at":"2026-04-22T07:24:53Z","title":"Rethinking Intrinsic Dimension Estimation in Neural Representations","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T00:50:49.134622Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2604.20276"},"observation_digest":"sha256:12b0f26c49105987e60fc25e3af23fac5681a5163f466b9fa76319783d9a9bab","observation_id":"3c2b3914-1d60-4f3e-98bc-aa448f7b5a53","resolution":{"observed_at":"2026-05-10T00:54:48.758900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.00764","last_updated":"2026-05-01T16:25:13Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T16:25:13Z","title":"Modeling Subjective Urban Perception with Human Gaze","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-09T19:12:54.038217Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.00764"},"observation_digest":"sha256:5f21ce0e1b184e6cb609f7f8726fce2e58c75c4a961a720742bb9cd66b945f18","observation_id":"5dfddba1-9fa1-4cb7-9865-0301af09c7ba","resolution":{"observed_at":"2026-05-11T15:47:15.929843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.02707","last_updated":"2026-05-04T15:13:47Z","snapshot_observed_at":"2026-08-11T15:50:36.045985Z","submitted_at":"2026-05-04T15:13:47Z","title":"SAIL: Structure-Aware Interpretable Learning for Anatomy-Aligned Post-hoc Explanations in OCT","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:35.927272Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.02707"},"observation_digest":"sha256:733f8a4af99b5b1ccc34c4daa45b8f8b17fea1271614cc2bce248fc7f65f0ac1","observation_id":"3ae6afd6-d479-48c3-9d89-a954915cdb15","resolution":{"observed_at":"2026-05-09T06:35:41.076077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.12570","last_updated":"2026-05-12T10:16:41Z","snapshot_observed_at":"2026-08-15T14:20:50.672129Z","submitted_at":"2026-05-12T10:16:41Z","title":"M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:57.769186Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.12570"},"observation_digest":"sha256:92a65ff46379979a62040a103d9d3251af4c8dded4389676d727e86083540e0f","observation_id":"fb19430e-446d-4162-a391-142c9a35af9e","resolution":{"observed_at":"2026-05-14T20:59:27.369856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.18466","last_updated":"2026-05-18T14:26:17Z","snapshot_observed_at":"2026-08-08T21:40:37.832970Z","submitted_at":"2026-05-18T14:26:17Z","title":"Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:40:19.027987Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.18466"},"observation_digest":"sha256:1a8073bce9a1a0c3740b631aa991955f805d1fa9eaf28eb21b3d711629c39107","observation_id":"aac02284-2aa9-466d-8eb3-fea5bf884b38","resolution":{"observed_at":"2026-05-20T11:43:15.188039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.20732","last_updated":"2026-05-20T05:35:45Z","snapshot_observed_at":"2026-08-15T17:09:09.655327Z","submitted_at":"2026-05-20T05:35:45Z","title":"Deep Attention Reweighting: Post-Hoc Attention-Based Feature Aggregation in CNNs for Disentangling Core and Spurious Features under Spurious Correlations","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T05:04:59.177437Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.20732"},"observation_digest":"sha256:ea463aa65f96eb037684c823265fba2bf8c70c82eeaf7355ec6b36592285eabd","observation_id":"608cde3a-c82e-4b76-bedb-069ef682970b","resolution":{"observed_at":"2026-05-21T05:09:38.768756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2606.18554","last_updated":"2026-06-17T00:08:35Z","snapshot_observed_at":"2026-08-14T06:51:40.841637Z","submitted_at":"2026-06-17T00:08:35Z","title":"Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:27.296146Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2606.18554"},"observation_digest":"sha256:f8f62d261b395a1c0c120eb3004b53e0fa12d20ee5f87cf5d7bad4bc92844243","observation_id":"098a2994-ae5d-49be-9b8e-8abbe2e85b91","resolution":{"observed_at":"2026-07-03T23:59:07.327251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2606.24192","last_updated":"2026-06-23T06:22:00Z","snapshot_observed_at":"2026-08-14T05:57:12.066340Z","submitted_at":"2026-06-23T06:22:00Z","title":"Co-occurring associated retained concepts in Diffusion Unlearning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T00:50:58.689718Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2606.24192"},"observation_digest":"sha256:ec9517a540bff016f1671fdc47f67444fea974d29ee93944ec49b9b6f5d57cba","observation_id":"e82670d2-c508-4a32-b824-a848a5d8f388","resolution":{"observed_at":"2026-07-04T16:09:57.478300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-11T19:58:05.484186Z","title":"Visual transformers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.04339","last_updated":"2026-07-05T14:45:29Z","snapshot_observed_at":"2026-08-11T07:47:48.052155Z","submitted_at":"2026-07-05T14:45:29Z","title":"One Framework for All: Cross-Modal Membership Inference for Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T19:58:05.484186Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2607.04339"},"observation_digest":"sha256:c536d1f2e1497956f028a7a7ebfd54f2efdc16edd1ed3fd9bf0f1498a75deeba","observation_id":"32837a37-b408-4ae6-9442-6e54b233b313","resolution":{"observed_at":"2026-07-11T19:58:05.484186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-08-05T00:38:04.305629Z","title":"arXiv preprint arXiv:2006.03677 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.00623","last_updated":"2026-08-01T12:29:38Z","snapshot_observed_at":"2026-08-15T17:12:17.376933Z","submitted_at":"2026-08-01T12:29:38Z","title":"Towards Effective Federated Multimodal Graph Learning via Navigating Multifaceted Heterogeneity","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T00:38:04.305629Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2608.00623"},"observation_digest":"sha256:af0bb2d6d8c057dfe284585614a2611b036a872ad43fac79e3c4bec1fcf4352a","observation_id":"cf25f6a4-819f-4763-a036-9e8d143a63d5","resolution":{"observed_at":"2026-08-05T00:38:04.305629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.03677/citation-record","integrity":"/paper/2006.03677/integrity","json":"/paper/2006.03677/citation-record.json","paper":"/paper/2006.03677"},"outbound":[],"paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T09:26:33.133589Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2006.03677."}