{"as_of":"2026-08-10T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3252d7b4f973aab360d85b898729987eb847830e79d1ea8a69da783a169e092","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:01:39.867668Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23373/citation-record","integrity":"/paper/2607.23373/integrity","json":"/paper/2607.23373/citation-record.json","paper":"/paper/2607.23373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-31T00:01:32.624103Z","title":"arXiv preprint arXiv:2509.23661 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.624103Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b22d1ee84a30636b7f7e5adf66b9e3c9472d500f1a3b26891d40dbb3378619cd","observation_id":"094bf45c-ea4c-4235-a8c0-cd09ff089442","resolution":{"observed_at":"2026-07-31T00:01:32.624103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:32.725286Z","title":"In: Proceedings of the AAAI Conference on Artificial In- telligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.725286Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:981e61a985bb863737dfe9030c25e64bf2ef40762efad98dab5c4202aa9558ed","observation_id":"f1d37e2b-ebad-45e0-a7aa-d5dc00248eb2","resolution":{"observed_at":"2026-07-31T00:01:32.725286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T00:01:32.858371Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.858371Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:36a8945587d521aba3d87f48f0a39fc806c50d06fc497385b80f3e1cdb8f423a","observation_id":"965803ed-75c0-4000-891e-cb6e51bad4ff","resolution":{"observed_at":"2026-07-31T00:01:32.858371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T00:01:32.922639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:32.922639Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c8069786f2273e72bc4e4c2305786a6c2556b37de3765c2d5a63023b15151c53","observation_id":"ff630cb5-78ae-4394-97c4-266bfe7f780e","resolution":{"observed_at":"2026-07-31T00:01:32.922639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-31T00:01:33.003935Z","title":"arXiv preprint arXiv:2004.05150 (2020)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.003935Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:4e9156d5292fbc45d4db666244887897a839f860aa23e97374a89bc2b87e26c6","observation_id":"07347f26-0010-46dc-a137-c82a5de590c0","resolution":{"observed_at":"2026-07-31T00:01:33.003935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-07-31T00:01:33.119140Z","title":"arXiv preprint arXiv:2504.13181 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.119140Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:cfa09e290471142d001adaf1b850f3335bf4ed9364cb962900c4f75b02459d27","observation_id":"5be5d2c5-d832-4de9-8fa8-ff1cbf161ede","resolution":{"observed_at":"2026-07-31T00:01:33.119140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.171167Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.171167Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:e245c51a9eaf101e20412248048ddcd7b194c89eadf5b80d34bb21ba46810142","observation_id":"d24f56e4-f760-42ae-8421-ae9c615a4d8c","resolution":{"observed_at":"2026-07-31T00:01:33.171167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.245005Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.245005Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:3f44b3b9ba15850fab8c13ae97bb6b7f42386a2078f98aa6897b7ae81fd40acd","observation_id":"5354d74b-5494-41bc-a951-10a73d61707e","resolution":{"observed_at":"2026-07-31T00:01:33.245005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-07-31T00:01:33.328665Z","title":"arXiv preprint arXiv:2405.17430 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.328665Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b9bc0c7dff3a18520b77ab319ab72f1573ad3f8ac52115fec848cecd08af5210","observation_id":"d659ef2f-90cb-45e5-99d1-923c05e3f84b","resolution":{"observed_at":"2026-07-31T00:01:33.328665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.418212Z","title":"In: ICLR (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.418212Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b28773912c7f8ff8a85109e5ae53eba39255c2deb2f5bcae4255de1b6d69d9c3","observation_id":"b80b76b5-a54f-4290-88b2-59a35f89dfad","resolution":{"observed_at":"2026-07-31T00:01:33.418212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.516741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.516741Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a71e40138915a8633ffdb22a8bd6b7f017dec3e96b6eb45e0251feaae4c596bd","observation_id":"cc0bd62c-9fc6-4c5a-ad42-aaed435e4fd3","resolution":{"observed_at":"2026-07-31T00:01:33.516741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-31T00:01:33.623542Z","title":"arXiv preprint arXiv:1904.10509 (2019)","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.623542Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b8cbf6ed127009c80804dfd8477975c0125cbe6cc912bb4c5f57b50a8e686a0f","observation_id":"f31595c2-338e-4243-870f-03797b5e21e3","resolution":{"observed_at":"2026-07-31T00:01:33.623542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-31T00:01:33.718457Z","title":"arXiv preprint arXiv:2402.03766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.718457Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0bdd2b015de37566c5ee9a9fb8e0bcccaab1a742d805bd0fea43a26592389168","observation_id":"ccfa5a24-c162-4fba-9837-a13979c35d7a","resolution":{"observed_at":"2026-07-31T00:01:33.718457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.803370Z","title":"In: Proceedings of the IEEE/CVF International Confer- ence on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.803370Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:68618f8c90591ba7355d8f18f056241a545d1b7c916ec1b6b14d4e870dea8675","observation_id":"966b53dd-de11-41d0-ba08-6fe1fc8d6a5d","resolution":{"observed_at":"2026-07-31T00:01:33.803370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.864979Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.864979Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:1f57fefe989246cce8957bf3bfb5fe4fbb6f1ad96bbdf00b9e41c7d7e494106e","observation_id":"f8c973fc-007f-411c-ac44-3ca37dce4eef","resolution":{"observed_at":"2026-07-31T00:01:33.864979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:33.911479Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.911479Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0bd8f5cb521f79be8887c17274b7b40c3e0d1b4de103b847cf2e6d3d3e3a1f04","observation_id":"898f5330-0203-4f9f-8d82-d5b332a18204","resolution":{"observed_at":"2026-07-31T00:01:33.911479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-31T00:01:34.050706Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.050706Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:af03bc28935d9111dfcd01887e500c3f84d9d47f3d4b76db7dfd6cb0bd97d94e","observation_id":"304e0e1a-e400-486c-bb2e-85c4149e3d25","resolution":{"observed_at":"2026-07-31T00:01:34.050706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.113031Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.113031Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:2221f900be078434ce9faa1e08f22730a2a744b14288a67e54b8200fd5a0bb54","observation_id":"8920c283-0f8c-49ef-a77c-6d7068b26b8e","resolution":{"observed_at":"2026-07-31T00:01:34.113031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.211569Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.211569Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:209679d4cccab068b5a0d9f973f741d54cc57b8e2719d35d600eaede21979aca","observation_id":"c3fb02bf-5c23-40ce-91cf-149d5d25eb02","resolution":{"observed_at":"2026-07-31T00:01:34.211569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.326764Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.326764Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:6275f05b4c4c1addadbe8e634c6d9b48c648d0efe1fd55c6451f61acdd9b12d8","observation_id":"c9262c34-fb72-4534-aed5-7ebca176928d","resolution":{"observed_at":"2026-07-31T00:01:34.326764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-07-31T00:01:34.400885Z","title":"arXiv preprint arXiv:2405.19315 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.400885Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:83dd9faf4994b725462865deb02079cf48b4aa299f1e50c0f3c1f3ae0fbed8d8","observation_id":"902cb00f-32af-4c09-9427-9dad7aedafb2","resolution":{"observed_at":"2026-07-31T00:01:34.400885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.480312Z","title":"In: Proceedings of the IEEE/CVF confer- ence on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.480312Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:20e8e1436a74f7f6537fe9a7d0470eaf4c12152331e54e6896ad5518ecfbb75d","observation_id":"d6084cd6-9915-4075-8734-7891f403498d","resolution":{"observed_at":"2026-07-31T00:01:34.480312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.628057Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.628057Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b107a728e0bc6a3fdf8ea1f2aaeca0e1761db96af69d20ade03fb8c09e0559f5","observation_id":"690679a4-1fea-4ca2-9699-b901c36c8feb","resolution":{"observed_at":"2026-07-31T00:01:34.628057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-31T00:01:34.711225Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.711225Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:87a040c6ad342232a4411732e95a0f23c95264305c7efdd068cbe54c4ed81b6d","observation_id":"e9675575-2c75-4aa4-a505-0b5133cc54cd","resolution":{"observed_at":"2026-07-31T00:01:34.711225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.779557Z","title":"In: Proceedings of the 2023 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.779557Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:8badb1b826c7f1f5d239f6d85381ec2a93fac85961e49eddf764650708cb9596","observation_id":"e62b6a09-3d5c-40f4-9451-00bf76278783","resolution":{"observed_at":"2026-07-31T00:01:34.779557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.854510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.854510Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:bae8236021c7ea5087b2c77d312a58821d9658d9aa9b262394e815970b2831e8","observation_id":"9313867b-121f-4fb1-8843-5667837e5615","resolution":{"observed_at":"2026-07-31T00:01:34.854510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:34.941159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:34.941159Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:e096486c87f44a2131174fed8e40ef17a49d341550398d8146b9470f27ab3523","observation_id":"bf7eea37-43dc-4d33-9d9d-ab3ab76ff443","resolution":{"observed_at":"2026-07-31T00:01:34.941159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.043229Z","title":"Science China Information Sciences67(12), 220102 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.043229Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:e4979a355c8e59d5e970a996a5853d87ef5759053f51de68ef58958a521d8051","observation_id":"1a5f5f1c-d61b-4d93-ba34-c416777594c5","resolution":{"observed_at":"2026-07-31T00:01:35.043229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.188413Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.188413Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:65930066861b528c52036a29ee1873cbef9200e8149364d5ce1b1606696083bf","observation_id":"6b5350e6-8f23-4bca-9f1f-b7bb25cca713","resolution":{"observed_at":"2026-07-31T00:01:35.188413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.260051Z","title":"Advances in neural information processing systems35, 2507– 2521 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.260051Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:3303c8d7222d04c4269fc42e9092f875ddb835a87faad178c288c97550df30b8","observation_id":"dac0d11d-68b8-4d53-a6df-1d698f3ad44e","resolution":{"observed_at":"2026-07-31T00:01:35.260051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.361614Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.361614Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:e5d470bd90f68a60ab68adf443a34f3a9fe83223a016e1eb97b598eeaada54cd","observation_id":"518b8411-0511-451d-9c2f-3f7e386c7d83","resolution":{"observed_at":"2026-07-31T00:01:35.361614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-31T00:01:35.403324Z","title":"arXiv preprint arXiv:2504.05299 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.403324Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c806ac48fc7bd27d5691b3d27840f50ed7d293089ce07eb207141c168e83c204","observation_id":"90f639cf-4016-478a-88b1-479bd5ad07ca","resolution":{"observed_at":"2026-07-31T00:01:35.403324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.480435Z","title":"In: Findings of the association for computational linguistics: ACL 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.480435Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:66ad11ef985cf98b7678d4a7ef8020f9970d3f46cb436d4792220424a9f3055d","observation_id":"0e022fb1-b882-4283-aa1d-3587102bf34d","resolution":{"observed_at":"2026-07-31T00:01:35.480435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.564805Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.564805Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:1d35f2efecf951749650487fbd567ffe2c4023db30f2da04088d30fb2a57aa13","observation_id":"1ef4d817-01bb-415c-b67f-34fc60606b83","resolution":{"observed_at":"2026-07-31T00:01:35.564805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.625122Z","title":"In: Proceedings of the IEEE/CVF winter conference on applications of computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.625122Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:d0b20de35c15d3d4a9e3ab0b5db87167872c016c6ea5023eb818e3f006d54dec","observation_id":"b0d7c3ed-df52-414c-b6dc-69d9332eef8e","resolution":{"observed_at":"2026-07-31T00:01:35.625122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02680","last_updated":"2022-06-06T15:31:35Z","snapshot_observed_at":"2026-08-03T05:32:57.281028Z","submitted_at":"2022-06-06T15:31:35Z","title":"Separable Self-attention for Mobile Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02680","snapshot_observed_at":"2026-07-31T00:01:35.791774Z","title":"arXiv preprint arXiv:2206.02680 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.791774Z"},"links":{"cited_paper":"/paper/2206.02680","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:9247c9fddd71cf26210d72acea681237326ed5b7c1eb65ab816137d7611e0bbb","observation_id":"efdc97a7-c351-4f85-8dea-eaeb47bfb5e6","resolution":{"observed_at":"2026-07-31T00:01:35.791774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:35.933720Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:35.933720Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:14e5638aa592bfccb9f1aaf27197f50f9d02c3c52a8fd5537ac1e1b3810ab7f4","observation_id":"fec8168e-c8aa-4f72-88ff-aadeb31d509b","resolution":{"observed_at":"2026-07-31T00:01:35.933720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-31T00:01:36.053011Z","title":"arXiv preprint arXiv:2304.07193 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.053011Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:82f0a08a9cc4d6a22c43a70265ec6d7133a9638cf68d8b3e4e14c5080c3cc841","observation_id":"392e581b-4f1c-4446-b7fb-56f766bf4b95","resolution":{"observed_at":"2026-07-31T00:01:36.053011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.212439Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.212439Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:594c730e9d89126185a23b569c9122eb7e83b7cab88bd4053ca4c2405eea6c70","observation_id":"66e7714e-842d-400b-a8c8-389fec46d6ea","resolution":{"observed_at":"2026-07-31T00:01:36.212439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.327194Z","title":"Advances in neural information processing sys- tems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.327194Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:425ebabd75762c2240fdd27959c0a61e665267fdef24e80ac7b28ec9272bd0e4","observation_id":"a9979fba-d67b-4110-9b91-9c616ac07627","resolution":{"observed_at":"2026-07-31T00:01:36.327194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.383614Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.383614Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:bad252da90ebd5b7fc5f84efb101e1ae7977bf82bdae392e414ca4aacca03588","observation_id":"4f957f63-a273-4a61-8e57-1132151a4b4d","resolution":{"observed_at":"2026-07-31T00:01:36.383614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.578277Z","title":"In: Proceed- ings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.578277Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:83caf35735b97673a47b226833dd5ca093bd608cd98ef5e536b6c4b6e50af956","observation_id":"ac691506-1418-418f-8642-8f1a39d66ff0","resolution":{"observed_at":"2026-07-31T00:01:36.578277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.708581Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.708581Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:2258d666a22a16e74c22864a341d930915c05e29a73b7f74f5950254a5e7ec8c","observation_id":"e08d5a83-4b32-47d6-99b5-eb49a7e53b41","resolution":{"observed_at":"2026-07-31T00:01:36.708581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.832203Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.832203Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:070dd012825ece23d46f12e55d72e99fc666702e881bb46f4611f812045cc352","observation_id":"8a8ec369-3840-4719-8f29-940fd50b73b5","resolution":{"observed_at":"2026-07-31T00:01:36.832203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:36.985781Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:36.985781Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a199b5c445c32bb0a21c4df8d41056ad9c0113d5398593313b9846948012a02e","observation_id":"b761f5b3-a653-4cf2-a64b-2b9000002e1c","resolution":{"observed_at":"2026-07-31T00:01:36.985781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.103468Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.103468Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:37a03540aa48f17b28687ddc34ffa212f6ee0d162a8a1061dc72118cc83a80d9","observation_id":"02974f28-d28a-42dc-84c6-9b21e8e4d729","resolution":{"observed_at":"2026-07-31T00:01:37.103468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.255686Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.255686Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:9d76b4569f516e1a4a9c48487432f80c5163cb8fdad9d42989d758f70a1f1233","observation_id":"0deded97-91c5-4093-8024-557daf45ee63","resolution":{"observed_at":"2026-07-31T00:01:37.255686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15485","last_updated":"2025-04-07T21:50:58Z","snapshot_observed_at":"2026-08-07T16:51:00.631813Z","submitted_at":"2025-03-19T17:58:57Z","title":"TULIP: Towards Unified Language-Image Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15485","snapshot_observed_at":"2026-07-31T00:01:37.402513Z","title":"arXiv preprint arXiv:2503.15485 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.402513Z"},"links":{"cited_paper":"/paper/2503.15485","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a4c073a8dd1a799b94147ff714c8b726559f0700fa99c714194772ddb234e85b","observation_id":"13e07a65-2d5a-469d-bf35-4e99ee468c0e","resolution":{"observed_at":"2026-07-31T00:01:37.402513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09792","last_updated":"2022-01-24T16:42:56Z","snapshot_observed_at":"2026-08-10T07:30:43.773450Z","submitted_at":"2022-01-24T16:42:56Z","title":"Patches Are All You Need?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09792","snapshot_observed_at":"2026-07-31T00:01:37.527536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.527536Z"},"links":{"cited_paper":"/paper/2201.09792","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:546ef6b76b5ec6be62bb3c62576e784cdbc371ef6f0c7c77e2ade0f4d9d1b9dd","observation_id":"26ef6db0-6940-46be-b7d9-cdf0d43f86c6","resolution":{"observed_at":"2026-07-31T00:01:37.527536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-31T00:01:37.632360Z","title":"arXiv preprint arXiv:2502.14786 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.632360Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:795a4907529e7e3a0b50d25afeac4a228210fae031c2c0b14964ee167f134d4e","observation_id":"3d24a58a-acf8-4e8d-b015-bf246446a3bd","resolution":{"observed_at":"2026-07-31T00:01:37.632360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.739735Z","title":"Advances in Neural Information Pro- cessing Systems36, 46830–46855 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.739735Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:d52ba034b0713df25100e426104ea000c05163c3c03db1f21aa8b5b204893c14","observation_id":"7cefa37e-9d15-48fe-97e3-bc8a10b72dc0","resolution":{"observed_at":"2026-07-31T00:01:37.739735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.864270Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.864270Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:92d11246c08320898fb597e34e1da61286daa7201013a7b95d6a6789e53579b1","observation_id":"43709f27-d5ee-443b-98f2-53beaa0abf43","resolution":{"observed_at":"2026-07-31T00:01:37.864270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:37.978165Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:37.978165Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b0067e251e1d453eafd1556269a3180c79064e7c5962829b9358a5fb1e0a7333","observation_id":"67ecff82-707c-409e-8f91-d081c975443c","resolution":{"observed_at":"2026-07-31T00:01:37.978165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.050580Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.050580Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:568b8f3b4bfb466d45e5879fad6c1100b31af02748e2d1ed919b83b45941e2fe","observation_id":"4ff79c6b-ed9f-4880-a567-30c7ae0c945c","resolution":{"observed_at":"2026-07-31T00:01:38.050580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-07-31T00:01:38.158513Z","title":"arXiv preprint arXiv:2205.14100 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.158513Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0f64157b6e4765645787faacccae611aa12d2db2f8ff4dddf905d8762fb4cc0e","observation_id":"f2cf568c-90f1-4973-80d3-e2ad1412f34a","resolution":{"observed_at":"2026-07-31T00:01:38.158513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T00:01:38.278782Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.278782Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:27dfb1137fa3886297db98821ceb73a8bca3eecef37b8bb51272b96f2df2e25d","observation_id":"215009d9-eed3-4b8f-a244-fb2b3fb76d13","resolution":{"observed_at":"2026-07-31T00:01:38.278782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.405105Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.405105Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:62325d37474ae607065213460e8c2c538ba1fbbb8a82550e9e6400e5322d4757","observation_id":"9e989e71-289b-4c80-acec-be3ad75f102b","resolution":{"observed_at":"2026-07-31T00:01:38.405105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.562942Z","title":"CVPR (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.562942Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:c1cd8eecccd671fb594283f272fcd83106e0a3d2830bfc129894d85cfe52feb2","observation_id":"73ff9c81-59b2-4b4f-a334-417a205cd2b2","resolution":{"observed_at":"2026-07-31T00:01:38.562942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.737392Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.737392Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:31fd343a7081c19c3b08e34e1dc7a8af13fee19ca0c99041bddd06d04c604385","observation_id":"2d6969b0-9ef0-468c-9bac-7297c78604e5","resolution":{"observed_at":"2026-07-31T00:01:38.737392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.805471Z","title":"In: The Thirteenth International Conference on Learning Representa- tions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.805471Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:78b8e0d7a86995e6172dcb6adf802eaa9ba41f77540ce4f2a73433c2c6f16513","observation_id":"879cc3ac-12cd-49fd-a0d2-a935d2e7f9d5","resolution":{"observed_at":"2026-07-31T00:01:38.805471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:38.927785Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:38.927785Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0af982d2d04808f003d836a9f4299c14682d1d3c88cc43b97a498a244fac0260","observation_id":"db39c310-8faf-4e46-bb8d-fd63e5af1d47","resolution":{"observed_at":"2026-07-31T00:01:38.927785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.027880Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.027880Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:0918a1d547ace3e6e992248eae13a6b634abc36dfb4c7ba06b1e11831b7c24d7","observation_id":"982fa184-a23d-49d3-9749-8c5c1ed3f9d4","resolution":{"observed_at":"2026-07-31T00:01:39.027880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.145738Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pat- tern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.145738Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:77a59226aea5b67c022cc276d2d0669747d35f183f20e2cbf243438e8c5d7e15","observation_id":"4a7a6ce6-7135-4398-809d-52fc868c2d20","resolution":{"observed_at":"2026-07-31T00:01:39.145738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.208088Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.208088Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:498aeaaa826507985554729bb833ba7491b2f8f2d3a486bf890519d62f8fb605","observation_id":"ca06b46d-6b45-4976-b46d-6285fe82513a","resolution":{"observed_at":"2026-07-31T00:01:39.208088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.326347Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.326347Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:f5fb5d3beeac84f208a367e438a209ec8356285aee5aa7ac9194e5a9221a9c80","observation_id":"5a712220-6839-4948-a204-d866fc4a2017","resolution":{"observed_at":"2026-07-31T00:01:39.326347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.434396Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.434396Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:8e27ff9858dafb262e42b17a134af09ad61bcc0090c4ac8c4fe97d5b88cf8b3a","observation_id":"62f12636-3703-4b1f-aa19-017e96d3ab07","resolution":{"observed_at":"2026-07-31T00:01:39.434396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:01:39.532976Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.532976Z"},"links":{"citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:36029a64ca2545ed076ada051207f3d6a40e9c478e5de334216f1468bdb15cf1","observation_id":"399b288d-08f2-4733-8220-7de4df0a0dba","resolution":{"observed_at":"2026-07-31T00:01:39.532976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-31T00:01:39.654463Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.654463Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:a71f710a48122aa517a97d673f5dbb8355a7bc104c4487c3f182ae9650bb5df8","observation_id":"3814d9e8-3e61-434a-a671-c35ad689f654","resolution":{"observed_at":"2026-07-31T00:01:39.654463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-31T00:01:39.738511Z","title":"arXiv preprint arXiv:2306.13394 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.738511Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:ee46866fac67b1e4fffcf152cea4f60ff9671e2bbdedecad9533f1eb46d2e11a","observation_id":"f1d4c1ff-9071-4986-8938-1af28d583a6b","resolution":{"observed_at":"2026-07-31T00:01:39.738511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-31T00:01:39.867668Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.867668Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:4e2614d0ed8c6d9f15f593c3dddbc73f2eee0ccad21eefe6f0a93e2d8a92c858","observation_id":"8fe9eb04-1671-44ed-966d-39493cdc64f6","resolution":{"observed_at":"2026-07-31T00:01:39.867668Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:22:29.452120Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.23373."}