{"as_of":"2026-08-16T21:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d922935d7a8f65b6b32a3ae3d18c998f8786e0e1d87cb4911eb28967121f0d5","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:29:09.281677Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:36.389460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:20:26.673617Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-08-07T00:40:36.389460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-15T18:08:39.252642Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:36.389460Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:0e896e7961fc8f6693b11daefa2c3aa70b97bbdda23bc509fa7f43cff7c8cfd2","observation_id":"cd619d8b-e160-4609-ba92-0965376c5715","resolution":{"observed_at":"2026-08-07T00:40:36.389460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":"2506.05709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token transforming: A unified and training-free token compres- sion framework for vision transformer acceleration","venue":null,"work_id":"292903b3-d9e9-4f61-9010-85847de54a98","year":2025},"citing_paper":{"arxiv_id":"2604.13432","last_updated":"2026-04-15T03:06:24Z","snapshot_observed_at":"2026-08-14T03:48:41.929598Z","submitted_at":"2026-04-15T03:06:24Z","title":"MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:06:09.392876Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2604.13432"},"observation_digest":"sha256:41c1cffd1c0401437c064f5c6866ff95cb6df2f556d5988f48182d0051a6e0b3","observation_id":"176cd46b-7d57-4bd3-b913-244b12844db4","resolution":{"observed_at":"2026-05-10T13:20:26.675894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":"2506.05709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token transforming: A unified and training-free token compres- sion framework for vision transformer acceleration","venue":null,"work_id":"292903b3-d9e9-4f61-9010-85847de54a98","year":2025},"citing_paper":{"arxiv_id":"2604.14563","last_updated":"2026-04-16T02:46:53Z","snapshot_observed_at":"2026-08-11T16:36:01.317213Z","submitted_at":"2026-04-16T02:46:53Z","title":"Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T11:31:52.126027Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2604.14563"},"observation_digest":"sha256:0e4c8669c1437c86b385d44e3130734e5a9c03e0ed44581affd8227ff549fef4","observation_id":"3d6a8040-3b49-477c-ba34-4d78edc3078a","resolution":{"observed_at":"2026-05-10T11:35:18.966902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05709/citation-record","integrity":"/paper/2506.05709/integrity","json":"/paper/2506.05709/citation-record.json","paper":"/paper/2506.05709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-07T10:29:04.281431Z","title":"To- 8 ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.281431Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:b667242dc9ccb9d467f564238fc7449200b477f349f568e3f185c9d035dd46f2","observation_id":"0888780a-745f-43c7-a35a-fbecf752f310","resolution":{"observed_at":"2026-08-07T10:29:04.281431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.388730Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.388730Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:64e0f1807ebffae63cee948917d6a6179f015f3a13245bd488ca7c42979f0e20","observation_id":"5cab2b06-3244-4ce3-831a-2e70ad67fb4a","resolution":{"observed_at":"2026-08-07T10:29:04.388730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.502992Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.502992Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:aa5f52daaab0fd97b37b2f377fe83965243725dcf07db33c845653d020e2b552","observation_id":"0b1abe6f-8215-4308-be29-9f31d4057c79","resolution":{"observed_at":"2026-08-07T10:29:04.502992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.652087Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.652087Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:bd863159589a56ae8a29efc35c9505a60bdc0a01161ad6a549a4e9b7cfc4dbed","observation_id":"4fb8e953-7fe6-4d69-868f-042896b35c86","resolution":{"observed_at":"2026-08-07T10:29:04.652087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:29:04.745969Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.745969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:5fa165b5794183e208ae7d9f5c6525e6dbb7b4a4cf7f4ae375a1a6184b8ff9ca","observation_id":"e9372569-a820-4c8b-b1ed-e90341c7b665","resolution":{"observed_at":"2026-08-07T10:29:04.745969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.701112Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"0fbda449-3100-42f3-8079-31b52a3b1890","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.879291Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:2a67569034e919574962816d90484f4987adee6283094719150abb0a43d4c539","observation_id":"f5b48f0c-07db-4424-98a3-57a965da433f","resolution":{"observed_at":"2026-08-07T10:29:43.711924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05331","last_updated":"2019-01-28T05:25:48Z","snapshot_observed_at":"2026-08-15T03:15:43.116157Z","submitted_at":"2018-10-12T03:00:59Z","title":"Dynamic Channel Pruning: Feature Boosting and Suppression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05331","snapshot_observed_at":"2026-08-07T10:29:04.957294Z","title":"Dynamic channel pruning: Feature boosting and suppression.arXiv preprint arXiv:1810.05331,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.957294Z"},"links":{"cited_paper":"/paper/1810.05331","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:69d395b1e278892be46f0bb24321d39d6df332499efd3d7033544bb00f111bca","observation_id":"a64d3003-f149-462d-8504-445086b060fb","resolution":{"observed_at":"2026-08-07T10:29:04.957294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.047412Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.047412Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:96a4958193dfa754ab86c81486f9671146a1c7197e5f458cfa1c2dd0fe9a3377","observation_id":"ef0f1ead-73e8-4bac-b6ee-714e548b1e29","resolution":{"observed_at":"2026-08-07T10:29:05.047412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.673030Z","title":"Dynamic neural networks: A sur- vey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11):7436–7456, 2021","venue":null,"work_id":"73d60e3c-0120-4837-b942-6580bdcdcf86","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.135319Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:0189c935a7533c91f80cdd3e8205de4a48c2ef899ff6f728af6e8ffe98e5dad6","observation_id":"b28c7a65-1c10-4b2c-8014-f04eef38c082","resolution":{"observed_at":"2026-08-07T10:29:43.681292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.210527Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.210527Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:987f66a9c257ded154601d0cad7ae6a168484c601065c61d724438870ac218ca","observation_id":"46435033-fb1a-4eb3-ad6e-fba69d2779bf","resolution":{"observed_at":"2026-08-07T10:29:05.210527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T10:29:05.342081Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.342081Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:17a2b71a4171ff752d92a6a5286b0a3c17fa4afec7edc466d38df3171a2a8ff6","observation_id":"b56a5213-dfa2-4563-9664-36861b6d4660","resolution":{"observed_at":"2026-08-07T10:29:05.342081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.637929Z","title":"All tokens matter: Token labeling for training better vision transform- ers.Advances in neural information processing systems, 34: 18590–18602, 2021","venue":null,"work_id":"0f5af39e-edec-42a3-8641-c8286cc7c810","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.430042Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:e77e031644c490db072ef6dfe0ae049052ad37fc01279bad6bc3c538872df841","observation_id":"bc203aa9-11cd-4c25-9936-ab7f1167166e","resolution":{"observed_at":"2026-08-07T10:29:43.651394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.617926Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":"89ea2383-5589-46aa-bdb3-14da03925b83","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.506428Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9fe7818828a27c1e6ace1e9bb9b0b1f6db4021626fbed487c83eaf68cbb4ff31","observation_id":"0db0ec9d-8003-4d08-9186-e582ca2adfaa","resolution":{"observed_at":"2026-08-07T10:29:43.624831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.595070Z","title":"Peeling the onion: Hierarchical reduction of data redundancy for efficient vision transformer training","venue":null,"work_id":"8c0ef6b2-7b7f-45a0-acdf-77de499888f0","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.585257Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:810b35335ece1adcf3e696aae66bbed4bc73f4d9d922dec49cf4a7167ec41d1d","observation_id":"a38b61e1-ebe5-4e71-a9c9-425a8547639a","resolution":{"observed_at":"2026-08-07T10:29:43.606625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.660989Z","title":"Token reduction should go beyond effi- ciency in generative models–from vision, language to mul- timodality.arXiv preprint arXiv:2505.18227, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.660989Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:791c2afce911e0f6de8e38ed38fa31453f1229d62755ea69ea71e73c3a752389","observation_id":"45dc1c5f-6e8c-4412-9a90-13b27f30a900","resolution":{"observed_at":"2026-08-07T10:29:05.660989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.569650Z","title":"Mpvit: Multi-path vision transformer for dense prediction","venue":null,"work_id":"4eb34822-93b9-45c9-9cdd-deba6d3425e0","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.744711Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:bc70e6423915905e83ae1d735722064caf6dc9c38524e133142cd8ae3c2e29d4","observation_id":"7745153f-5938-43a9-9bcb-ddd347d7c914","resolution":{"observed_at":"2026-08-07T10:29:43.580185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.539411Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"540de958-705e-40f9-83e2-e4f48e0e1106","year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.823630Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cbf5e3949c39f2bceb6c52a9550f85310a8273e0a3b64e10f48b7a9f59966120","observation_id":"ebd511db-f48c-457c-a81e-9910295f8dfb","resolution":{"observed_at":"2026-08-07T10:29:43.554998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.513798Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"77b2a79c-f832-4cca-ac68-6b52791f41a2","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.934640Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9e3012c561cd7ac795d24510a2ed558b7e9cb60aa8df850f35f97546fe94ec74","observation_id":"35781d02-da4d-4d47-b89e-e82f19139409","resolution":{"observed_at":"2026-08-07T10:29:43.527097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.489636Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"bf4a95f3-a2ab-444e-a133-d0c87755ecb8","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.014456Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:12f4fc153a1782a88950a23d72e4edd25d2c508bcd54dc80f1eb5d3798a59740","observation_id":"6f97ca6a-6c2a-441f-bf9b-056cfbe1cec5","resolution":{"observed_at":"2026-08-07T10:29:43.499169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.467240Z","title":"Expediting large-scale vision transformer for dense predic- tion without fine-tuning.Advances in Neural Information Processing Systems, 35:35462–35477, 2022","venue":null,"work_id":"641e062a-5556-4f2e-9b87-87ed0aa43ee6","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.111149Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:e9945431786fa6764fdcbaf73fe25caa13323f8862e2982ffa2f9b2580a50dcf","observation_id":"3187dbc6-bf1c-4d47-b63b-1d61bb3e8225","resolution":{"observed_at":"2026-08-07T10:29:43.476808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T10:29:06.229026Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions.arXiv preprint arXiv:2202.07800, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.229026Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c5bd0245145055dbb4d428481e709f98a34a744eb1ad2d2cf6984f5a3845f310","observation_id":"4ea22053-9204-4db7-8171-e2f7f4ebb9c3","resolution":{"observed_at":"2026-08-07T10:29:06.229026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.305116Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.305116Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:f404a127effb1d62ab9bbff7cd3ff7a30857cf9e6a8f913a0ff367d92df03191","observation_id":"12b87abb-f5f7-4210-b8ce-fdacd94047db","resolution":{"observed_at":"2026-08-07T10:29:06.305116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.392937Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.392937Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cc2a23b78a74c279647106b304abedb756d1bd0c2d3ef0d319ead7c245616579","observation_id":"43770335-d3c0-455d-ad52-55898dd40e3d","resolution":{"observed_at":"2026-08-07T10:29:06.392937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13802","last_updated":"2023-07-06T10:49:33Z","snapshot_observed_at":"2026-08-16T16:29:22.216564Z","submitted_at":"2022-09-28T03:07:32Z","title":"Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13802","snapshot_observed_at":"2026-08-07T10:29:06.482067Z","title":"Adaptive sparse vit: Towards learnable adaptive token pruning by fully exploiting self-attention.arXiv preprint arXiv:2209.13802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.482067Z"},"links":{"cited_paper":"/paper/2209.13802","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1c743496ffafb3fc1469d7fcb60bc7d3fffbee8a56d83e530b72b3c72889444f","observation_id":"860ec1a7-aee1-403f-8680-eb4b3b6ebb18","resolution":{"observed_at":"2026-08-07T10:29:06.482067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.552259Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.552259Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:591ecfd645a8c41465510624feb61079748a3190d832b2a150d28cdc06478716","observation_id":"33436fba-e7b2-4490-ada3-601545fe07d2","resolution":{"observed_at":"2026-08-07T10:29:06.552259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.414854Z","title":"Beyond attentive tokens: Incorporating to- ken importance and diversity for efficient vision transform- ers","venue":null,"work_id":"ec3919cf-1b62-432f-a080-4527fe32d09c","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.636831Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:0c0fd8317006acc8904f9badd1ec1552f9e77d0c5bd11f3a301ab178d5e897fa","observation_id":"979a44d9-6da2-46b2-9c21-3b0c8a1f665a","resolution":{"observed_at":"2026-08-07T10:29:43.428964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.746497Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.746497Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:97320e10bade71d2c46978147ef453dc2b3b5c307237bc9d1259460286ef08ed","observation_id":"8009a827-c332-4af3-857d-f6ca9329f6b4","resolution":{"observed_at":"2026-08-07T10:29:06.746497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.267461Z","title":"Importance estimation for neural net- work pruning","venue":null,"work_id":"a54b595c-3673-4089-a61f-951fb6e8c6ca","year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.834295Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cb9712d539f163bba4096805678f75d400d672281c8d13ce907c059a9927a278","observation_id":"2c5cf6f9-377d-48bf-9ce6-902d88ad763e","resolution":{"observed_at":"2026-08-07T10:29:43.391781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.910131Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.910131Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:d36e588e6ae98a2df4af79b251ac1c07e7f57db76ac7aec16a77a74ecb081e71","observation_id":"389c33d8-09c4-43d5-8a3d-b274e8ee555d","resolution":{"observed_at":"2026-08-07T10:29:06.910131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.069749Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"386932cb-4277-401a-8bbd-7b74f6abbcce","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.981966Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:6f09488639ee4b6bae87834db1708ddf5b566ed630b6cbd32cd4150b159719b4","observation_id":"be14cf72-3f22-4df1-aa32-85e1491bf8af","resolution":{"observed_at":"2026-08-07T10:29:43.130693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.068786Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.Advances in neural information processing systems, 34:13937–13949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.068786Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:53e7bd0a723c0dddaf244d5c19e5b28925e565614f56ee9b144f2e92f286b768","observation_id":"bd498842-e345-4559-80c2-2c70f62f00f0","resolution":{"observed_at":"2026-08-07T10:29:07.068786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.920008Z","title":"Beyond fixa- tion: Dynamic window visual transformer","venue":null,"work_id":"9cc4e993-1003-4034-90b4-fb4c261ca782","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.153073Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:bd59f3f1355045ae607bfa6a460a4af37235e5e58678e9b0f66c69593380465f","observation_id":"c4914461-08cc-4b41-aa12-1558c457f3b5","resolution":{"observed_at":"2026-08-07T10:29:42.989923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.809464Z","title":"Tokenlearner: Adaptive space-time tokenization for videos.Advances in Neural In- formation Processing Systems, 34:12786–12797, 2021","venue":null,"work_id":"dc56ce79-a603-4f17-b9d1-0fe25f70adc7","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.225649Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:fb896571a6e39849088f17cc2dd3d9cd9192a8a9bc1fb06e689922a8bf7d907e","observation_id":"c15a2e28-18e9-45f3-b269-8df503a92712","resolution":{"observed_at":"2026-08-07T10:29:42.845527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.294589Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.294589Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1c479dce1b42f63f98eb60411ee87e0bedf0c54d1198c704492fa9d9403029f1","observation_id":"599cf5bd-dd11-4724-8683-bef66c8ba766","resolution":{"observed_at":"2026-08-07T10:29:07.294589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.373418Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.373418Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a649ac60f0f7509df6c49f584e84e8e388f9a2867831737d149413e037d0d135","observation_id":"0c617dbe-ca68-4420-8bfa-56e394ba68d8","resolution":{"observed_at":"2026-08-07T10:29:07.373418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.438068Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.438068Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:2faeb68ecc102bd54970853551e1ec4d012b471c3e7edb355e3c481e2549f0b0","observation_id":"f38efc45-34f6-4c89-9451-0a85d54ac8b4","resolution":{"observed_at":"2026-08-07T10:29:07.438068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.664138Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":"9bdaedcd-2f6b-468d-9ea3-d2974e292539","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.536108Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:f49a3da6f67cce5042fa30cf1f5bc95fc312d070d8beb1e61448f89b08c0d7c6","observation_id":"dc0e95be-ffb6-4161-bdbf-bf987a02c641","resolution":{"observed_at":"2026-08-07T10:29:42.738363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.626801Z","title":"Segmenter: Transformer for semantic segmenta- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.626801Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c0fdfd01c438a859461466c1f2c443c76c159db3691ba5a8621e181edbb3b50a","observation_id":"180647af-62ad-4a1c-a0c8-5fd678508398","resolution":{"observed_at":"2026-08-07T10:29:07.626801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.694796Z","title":"Chip: Channel independence- based pruning for compact neural networks.Advances in Neural Information Processing Systems, 34:24604–24616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.694796Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:8106f9c19cce2cc257edba192cef53e8462b80703b81fe876bc639c615d3cf8d","observation_id":"3bf620c2-ed9e-41c9-9bb4-b3d7605a99f3","resolution":{"observed_at":"2026-08-07T10:29:07.694796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.519671Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"30a366e7-4edc-467e-ad38-e0a828d5f34c","year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.784186Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:acd6b4061dad246caebeea23f245e3524e2dc35a7c506b882fd4ee23b8acc6d1","observation_id":"665c0120-0de5-4f2f-b165-53a8a84b86ed","resolution":{"observed_at":"2026-08-07T10:29:42.560510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:11.118397Z","title":"Patch slimming for ef- ficient vision transformers","venue":null,"work_id":"80b194fb-7959-45b0-939a-06bf7d8d4ae2","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.843474Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c17c78f8e3608ebaa1dcc053c18d9cc902586b37e5c98cc9796ae7650bb5c620","observation_id":"7642238b-05ad-4b54-95bd-5a92d8873de0","resolution":{"observed_at":"2026-08-07T10:29:42.468333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.987098Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"b96c0c3b-eb89-4a02-ab93-fb6bddb4a36f","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.913513Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c420002332710ba7e7dd054303d61395d12454010ad4e35190270bd265b04c41","observation_id":"63b54ada-a354-421e-8569-7910f6534099","resolution":{"observed_at":"2026-08-07T10:29:11.049320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.974529Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.974529Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a5d8c34305adb9a352bd0fcd6df6f796dcc65550a21fb1ce53734265dae82a1f","observation_id":"e790d5cb-ccf1-4974-9c54-65424d8265f7","resolution":{"observed_at":"2026-08-07T10:29:07.974529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.832487Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition.Advances in Neural Information Processing Systems, 34:11960–11973,","venue":null,"work_id":"e819a1a7-9e50-48c2-8ae8-59a6043603a9","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.053653Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a627938dae275182f2bdcf79482e3690a0e9a50816cd9b09111203e4c4ab7271","observation_id":"6265c65b-848b-463c-846e-00f2bf5bfa08","resolution":{"observed_at":"2026-08-07T10:29:10.912369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.656451Z","title":"Qsfm: Model pruning based on quantified similarity between feature maps for ai on edge.IEEE Internet of Things Journal, 9(23):24506–24515,","venue":null,"work_id":"46ed4105-f35f-45a2-8fde-2dd59c0e0425","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.136865Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:03fb10c536e3718e243f75882e054eaa8e8a9d981fcf135d372a39aa9c7e64d9","observation_id":"040418a6-dfae-4977-97f0-68ce49ba74f6","resolution":{"observed_at":"2026-08-07T10:29:10.741796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.503836Z","title":"Joint token pruning and squeezing towards more aggressive compression of vision transformers","venue":null,"work_id":"8a4ee99b-6a6d-4adb-9fd4-27aecfbaf8f2","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.203119Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cb785a0e019e5ed1a98ea14e3198af110c2f10464b724ce23cd86031fedbc409","observation_id":"63559539-8457-4376-a2e8-b9030fb3dafa","resolution":{"observed_at":"2026-08-07T10:29:10.586451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01812","last_updated":"2024-02-05T09:21:28Z","snapshot_observed_at":"2026-08-16T14:55:36.163199Z","submitted_at":"2023-10-03T05:55:11Z","title":"PPT: Token Pruning and Pooling for Efficient Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01812","snapshot_observed_at":"2026-08-07T10:29:08.280794Z","title":"Ppt: Token pruning and pooling for efficient vision transformers.arXiv preprint arXiv:2310.01812, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.280794Z"},"links":{"cited_paper":"/paper/2310.01812","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1c1a5e0e6e77d8250c3902d31cdd7c8a799be68dfcdef80035ab46ac841c8198","observation_id":"32e2e7f0-0d15-4941-a2d5-1f0e6db7e66d","resolution":{"observed_at":"2026-08-07T10:29:08.280794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.347547Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer","venue":null,"work_id":"cfbbc6ff-c2f6-4774-b6c7-1d23c7a53418","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.344854Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:d7c08aa32b5bb288f998559fcd413eb02a5670888066d8fa7e78f8762502b49c","observation_id":"eca5658d-1943-4dc2-8b1a-8f62dab531a8","resolution":{"observed_at":"2026-08-07T10:29:10.423172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.195329Z","title":"Global vision transformer pruning with hessian-aware saliency","venue":null,"work_id":"eaca0faa-47b9-4537-8fe2-6adebf6b5b99","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.423711Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:dfe3ae7a6db94befd0135c71f97da6d5ea1cc5e60c60572f7fff75220e0082b3","observation_id":"72664a1a-4b25-4c08-bda6-24766bf60a3e","resolution":{"observed_at":"2026-08-07T10:29:10.254561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.068471Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"34518172-d9d4-4097-af81-6b4b5f2afd65","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.504518Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c7fcd7533de962acea87b612d9e46c6dc15fab45f1a5f5f65e394f74f8192483","observation_id":"7c47a347-b9f8-4c80-99c0-4ebe1b3fd104","resolution":{"observed_at":"2026-08-07T10:29:10.129384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.955464Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet","venue":null,"work_id":"719efc1c-5814-487a-95dd-6c166123529b","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.575250Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9ff3ca9e4f7c5480ebf947bf5e102922b8bcb6cb4daa0618f790d3424fc01f22","observation_id":"63afa598-10e5-4f57-88f8-492bde008644","resolution":{"observed_at":"2026-08-07T10:29:10.005623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:08.661650Z","title":"Vision trans- former with progressive sampling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.661650Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:37dd1c8824cda5fd5a0572aa44e32ab09379645a46b01afae19f2428125c327e","observation_id":"2e68c206-74c2-4a0f-8819-3c2255aeadc6","resolution":{"observed_at":"2026-08-07T10:29:08.661650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.814452Z","title":"M2m-tag: Training-free many- to-many token aggregation for vision transformer accelera- tion","venue":null,"work_id":"2db7f96b-5771-462d-86e6-e2fe519204b2","year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.730983Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:087ee50aa8ce8faca0214a6a19940c2ea058346afe440a990cef75e8f28dc228","observation_id":"a6d25efe-71d6-421f-a3f2-91d162418698","resolution":{"observed_at":"2026-08-07T10:29:09.878326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:08.831348Z","title":"Parameter efficient merging for multimodal large language models with complementary parameter adaptation.arXiv preprint arXiv:2502.17159, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.831348Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:e0a62e686485e27b7c6d476833f3b9a1c913fad9198022ffa7305ad21b10731a","observation_id":"26b79f09-84bc-4d47-93d4-63977eb608fd","resolution":{"observed_at":"2026-08-07T10:29:08.831348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-07T10:29:09.058019Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection.arXiv preprint arXiv:2203.03605, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.058019Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:81c635279d403911054e98def4cb54541e0803776e82aafbf06afca7d144c081","observation_id":"826c9cc8-af54-414b-8c2e-909cd64c8e08","resolution":{"observed_at":"2026-08-07T10:29:09.058019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.682550Z","title":"Semantic under- standing of scenes through the ade20k dataset.International Journal of Computer Vision, 127:302–321, 2019","venue":null,"work_id":"4daf8dc8-ea0f-448b-8ce4-b720577a3c76","year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.281677Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:8bd17f2d916174c3f4916c4f194df64d1cc2ef3ac4a707d4e0582338f828eec6","observation_id":"9079dc22-0f25-4fa9-87b7-94dd8acfa084","resolution":{"observed_at":"2026-08-07T10:29:09.750518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 3 inbound Pith citation observations for arXiv:2506.05709."}