{"as_of":"2026-08-14T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6c8537bedec75e2fe45a6419f21182fd14dbd5efbda46e378c6d96be8cf3de9","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:27:13.689128Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:57:21.526961Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:57:29.885926Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"cited_work":{"arxiv_id":"2501.01709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01709","snapshot_observed_at":"2026-08-06T23:57:29.885926Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","venue":"cs.CV","work_id":"d01fc27b-b849-4405-8535-526169cc6c09","year":2025},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.526961Z"},"links":{"cited_paper":"/paper/2501.01709","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:34ec6b786787bec974b53bd4f6f52a783351fdfe9ec30c958f16da4b601b2ca2","observation_id":"67cb66a0-1f7c-4564-97a1-625fa7ed7c47","resolution":{"observed_at":"2026-08-06T23:57:29.890113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01709/citation-record","integrity":"/paper/2501.01709/integrity","json":"/paper/2501.01709/citation-record.json","paper":"/paper/2501.01709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:27:13.382925Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.382925Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2c4a84507491922a68ab71087b4753f54618d049dfbe8376422fcc02da64416f","observation_id":"cf6a0da2-a87d-43cc-8679-884247b53839","resolution":{"observed_at":"2026-08-10T22:27:13.382925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.389227Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.389227Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:8dc9ff4ffc94b9a5876d59a5cc741ea48c87ef648c27df9897f2256e8733d240","observation_id":"72bc8d5d-2859-488b-9811-fdd6089aacd4","resolution":{"observed_at":"2026-08-10T22:27:13.389227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15414","last_updated":"2024-02-23T16:20:29Z","snapshot_observed_at":"2026-08-13T22:47:17.896639Z","submitted_at":"2024-02-23T16:20:29Z","title":"Does Combining Parameter-efficient Modules Improve Few-shot Transfer Accuracy?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15414","snapshot_observed_at":"2026-08-10T22:27:13.394598Z","title":"Does combining parameter- efficient modules improve few-shot transfer accuracy?arXiv preprint arXiv:2402.15414, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.394598Z"},"links":{"cited_paper":"/paper/2402.15414","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:3122a858c4b9bd6c3de82e5c29cbc988a1bdfc8b0c7dd50ff465085df7f43425","observation_id":"394a6094-ea0f-44c6-aa33-56a8d98c6341","resolution":{"observed_at":"2026-08-10T22:27:13.394598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T22:27:13.400410Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.400410Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:74f634a7b15d097be76df2cb32d86bf47ce00c336a5f9775b3b4409c32011fc8","observation_id":"29eadd2a-b321-4116-aaba-f565bcd3dc3b","resolution":{"observed_at":"2026-08-10T22:27:13.400410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:27:13.406616Z","title":"Qwen-VL: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.406616Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:724730a82c4739a611479ce9ba99f254e56f1e7a973efd05eef4c10c353b957b","observation_id":"c1af4069-2089-434c-a895-c190c413f8ee","resolution":{"observed_at":"2026-08-10T22:27:13.406616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-10T22:27:13.412710Z","title":"Deepseek LLM: Scaling open-source lan- guage models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.412710Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:5d60e61f30a7e670802aefbf8a073fdc6d23524c73b1b453908ce96496393519","observation_id":"2687125c-24e1-48de-ab2e-96b715d75515","resolution":{"observed_at":"2026-08-10T22:27:13.412710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T22:27:13.420168Z","title":"InternVL: Scaling up vision founda- tion models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.420168Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ce19f3f40a67e2544dcdfbefc651c437c6becac9f11397ec59e54d6862269a6f","observation_id":"e50f52a4-ca56-4c32-a693-2cd55c8f7e59","resolution":{"observed_at":"2026-08-10T22:27:13.420168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T22:27:13.427397Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.427397Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:e0507e8b251e308ef088c344835686b26846eca0c95abf1993ec3b775bd40fe8","observation_id":"f2fa7aa1-aa03-43d2-87b6-742b494381e7","resolution":{"observed_at":"2026-08-10T22:27:13.427397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.620889Z","title":"Vision transformers need registers","venue":null,"work_id":"f383b7d9-657d-44fc-9c1d-8bd7819aceda","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.436265Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:6b0f82c0a0badd880a7c378743c412d8f15be2ad8f99a16362e0f9838745b8c0","observation_id":"4034b046-be82-4ccd-ac3f-6a160a373862","resolution":{"observed_at":"2026-08-10T22:27:14.627450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.441521Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.441521Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:390fcf634323c9f8453fe5146559ffc8a5174729acadb0772756a73920653832","observation_id":"8aec9829-59fc-488c-b5c1-76ea0e4368cd","resolution":{"observed_at":"2026-08-10T22:27:13.441521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T22:27:13.447468Z","title":"MME: A comprehensive evalu- ation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.447468Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:39a1385cc59ecd93d2d5f11401f97b43108bad62b0d9ff1c8f15bcf5bb25a165","observation_id":"65d36236-5e96-4cbd-9627-66da1a147166","resolution":{"observed_at":"2026-08-10T22:27:13.447468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.452669Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.452669Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:26cdc8ae2de2bf52b1d8374aad75e412ca39dc603956c5e327f31ffe95b0a938","observation_id":"578d87cc-5f4c-4c24-8401-dedc8188ec17","resolution":{"observed_at":"2026-08-10T22:27:13.452669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.458349Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.458349Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:054b5f47f714e61a88a618fc3994d8d75fc822a23adce923ceb6e77d456e5fc5","observation_id":"daca6a56-0b16-47e8-b833-314ee6d83281","resolution":{"observed_at":"2026-08-10T22:27:13.458349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.464635Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.464635Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:15865ddc5e1400c0245aac54c9699685b51273b008fe8bf7509e169ba7cd287f","observation_id":"bba2ffc5-ee89-464a-9fbc-86b4d9ca3449","resolution":{"observed_at":"2026-08-10T22:27:13.464635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T22:27:13.470237Z","title":"Distilling the knowledge in a neural net- work","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.470237Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:87027596c64f1e40bc7896277cc21e0d1451d1e88c3b09b37ac1732cc72be266","observation_id":"488b43f6-0e74-4076-bee2-cd45e28ef5b9","resolution":{"observed_at":"2026-08-10T22:27:13.470237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:27:13.475542Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.475542Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:4ac8219727724db3b54b43b3c1c953f605105980a7783611e6ce21a29f3b9ba3","observation_id":"5271c9cd-2ae0-461f-85cc-35d4c849efe7","resolution":{"observed_at":"2026-08-10T22:27:13.475542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14589","last_updated":"2023-03-02T14:10:40Z","snapshot_observed_at":"2026-08-11T05:21:07.129406Z","submitted_at":"2022-05-29T07:32:00Z","title":"Masked Distillation with Receptive Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14589","snapshot_observed_at":"2026-08-10T22:27:13.480425Z","title":"Masked distillation with receptive tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.480425Z"},"links":{"cited_paper":"/paper/2205.14589","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:414adfef0e67a3cead39ce259921d8413f31e9618156acb41fb82fcad9606a27","observation_id":"d5f3b0c7-f067-4180-a8e8-8e2f027fb0d0","resolution":{"observed_at":"2026-08-10T22:27:13.480425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.563041Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"75b14c9f-45cc-4379-8d44-c4379b5b52d1","year":2019},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.486669Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:3cc5374d9ea121ea6a195cf119fec77975f1816a4c55a7ec4e3f907e7177634d","observation_id":"f62af99d-6761-4c4f-8e45-5d29316f57ed","resolution":{"observed_at":"2026-08-10T22:27:14.568334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.492983Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.492983Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:46d89acbf0c6ad2158e052259e816859e212c62cfc0b90ebf857ca3e1346f29c","observation_id":"87fc07ba-5945-4995-863d-0ebb0777647d","resolution":{"observed_at":"2026-08-10T22:27:13.492983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.534970Z","title":"Lift3d foun- dation policy: Lifting 2d large-scale pretrained models for robust 3d robotic manipulation, 2024","venue":null,"work_id":"63476f54-d696-4cf8-a812-941fc3e93616","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.498263Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:f08118fbaf37158db0cdbac2a24a2a215eedd3a8bf4b1ab4d62760a9497877d2","observation_id":"6154a4ab-ccde-4993-8d97-e860da380d1c","resolution":{"observed_at":"2026-08-10T22:27:14.540306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.507315Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.507315Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:b3ba9796b49d449cd90c3cea49cb7f2813fa4f78f2eba0a30a23dbc0fe0373da","observation_id":"abd0a356-d95e-490c-9744-21e05817f992","resolution":{"observed_at":"2026-08-10T22:27:13.507315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T22:27:13.513574Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.513574Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1199af7cee2a2ce767961d02c0a8dd795f550c8fc440db862298da359576c1db","observation_id":"6c29da05-1f08-4f24-a27b-e8095cba03dd","resolution":{"observed_at":"2026-08-10T22:27:13.513574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11273","last_updated":"2024-05-18T12:16:01Z","snapshot_observed_at":"2026-08-13T00:04:37.436381Z","submitted_at":"2024-05-18T12:16:01Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11273","snapshot_observed_at":"2026-08-10T22:27:13.519870Z","title":"Uni- moe: Scaling unified multimodal llms with mixture of ex- perts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.519870Z"},"links":{"cited_paper":"/paper/2405.11273","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:4d7018537f49eca7ac653757094849eec3fa2338bf6d4902e01c0caa9895702d","observation_id":"cb110152-8f13-4916-a61a-3729b7c2f7d1","resolution":{"observed_at":"2026-08-10T22:27:13.519870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T22:27:13.527145Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.527145Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:126f00ea8f8b7b6a0cad82526bfc522789a6d77f6b92c165a9ff6ee5d50e74c8","observation_id":"101b2808-9905-4246-8aaf-4da0ed31e7c7","resolution":{"observed_at":"2026-08-10T22:27:13.527145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-10T22:27:13.532542Z","title":"Moe-llava: Mixture of experts for large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.532542Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:e0add9581ae8e4a52bcc9d8bb769d290752d42378092180863159fc1d76dd3e9","observation_id":"c2d3d16b-74e6-4b1f-8485-73d85e27d9b2","resolution":{"observed_at":"2026-08-10T22:27:13.532542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-13T00:41:56.015469Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-10T22:27:13.538320Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.538320Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:68e8228a5111ff17a8ea834d354da1370a56b51df711eae2c62244d4cd0406ff","observation_id":"3b8063a9-da3c-4c10-9bca-b042bab36ae5","resolution":{"observed_at":"2026-08-10T22:27:13.538320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T22:27:13.543646Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.543646Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:9e2b02784fad9060bbc5e59a71896a9a17b72dc8c0aae60abbb789ae01b60e12","observation_id":"6f68b4fa-2d80-436e-85a4-0f58ef3f9bdc","resolution":{"observed_at":"2026-08-10T22:27:13.543646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.548511Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.548511Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ca2a5ff361de09e2982ec55de21f78aa311f6b59c7738d95beb525ca1de88428","observation_id":"2974143e-4c3f-48c8-b346-855f5fb5070f","resolution":{"observed_at":"2026-08-10T22:27:13.548511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.497542Z","title":"Visual instruction tuning","venue":null,"work_id":"7fdbfdf0-a8b2-4b73-9fa5-69a5f44d2193","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.553737Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:fd141bf9416080942f4b44efc3879ea389e0ec131cbc25bbb311e8ee1209bfa0","observation_id":"50f0df7c-440d-4b04-9783-e3aab29c2115","resolution":{"observed_at":"2026-08-10T22:27:14.503141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T22:27:13.558488Z","title":"MMBench: Is your multi-modal model an all-around player? arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.558488Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:05f68dbf68108d4d321de718a52c2dd9ebbfc1c0a174d2ac453a22c9377b7583","observation_id":"7eb9eb38-33d2-4e57-b0f5-ef1c3e9b7ff7","resolution":{"observed_at":"2026-08-10T22:27:13.558488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.564407Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.564407Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:0612dd81f3d02b414c28fc3a1f5f798cb39609114b6d81b8fa62865c840e8ddb","observation_id":"cbafa25b-627d-46b0-85b8-438fd0be0cda","resolution":{"observed_at":"2026-08-10T22:27:13.564407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.570609Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.570609Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:58b0285a8547f3a8f6f9213da5ef75d0c42c1ebd8dfb983b735bcb265f491822","observation_id":"205b5671-f1d1-48e7-9646-48d2498a0787","resolution":{"observed_at":"2026-08-10T22:27:13.570609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.454672Z","title":"Llm as dataset ana- lyst: Subpopulation structure discovery with large language model","venue":null,"work_id":"cd805172-1d9c-4850-9889-2ac7cb9cd205","year":2025},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.575854Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:6f7472666babcd5badeb93aeca8f00f5e3cbd6c1023ae32142edcc777d1447b5","observation_id":"80498a9c-ada8-4563-95bd-d9a85ce414c6","resolution":{"observed_at":"2026-08-10T22:27:14.460442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T22:27:13.581901Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.581901Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ca0eee01f6d32a03daa5aa7e701ebae8446d46d23feec1f5a01278f8a35340c4","observation_id":"2607c897-9f4b-40d7-b82c-a561a42ab248","resolution":{"observed_at":"2026-08-10T22:27:13.581901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.436097Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"05e7e657-dcde-47ac-9854-48a9d0e5634b","year":2021},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.589164Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:a2d3ae62c0e7d2db77f5fe54db570511c5eb658e4c19da2e686c0a22fe27b39f","observation_id":"12b5d433-b490-4924-927a-714bfe6a51f1","resolution":{"observed_at":"2026-08-10T22:27:14.442625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.412636Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"1f8c8807-6348-4001-8323-89844b8625c1","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.594849Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:dd2658c8eae458e06b963ab6a235ee906c750f83cf1f6295dd25ab7f4aeaecd4","observation_id":"fdfdba85-9aec-4478-9b2c-c5f8a7ad38ee","resolution":{"observed_at":"2026-08-10T22:27:14.419028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.392310Z","title":"When do we not need larger vision models? In European Conference on Computer Vision, pages 444–462","venue":null,"work_id":"2ab6eaf4-3cf6-4f59-a1e8-29f989ae7687","year":2025},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.600081Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:eed853ff530c57e1a3cd9a94ef41f97287f8460ee0aedc703cb72c105e949887","observation_id":"b8b51a70-6c67-4186-bf91-29f9eda3a3ca","resolution":{"observed_at":"2026-08-10T22:27:14.397989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-10T22:27:13.606238Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.606238Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:0fef5fd1803e548dc8cc4449ea55817dd74f24411106f677ce168f7b26c7005f","observation_id":"cea5852e-cdf8-4cd4-90d7-0adf3091d588","resolution":{"observed_at":"2026-08-10T22:27:13.606238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15881","last_updated":"2024-10-23T09:52:23Z","snapshot_observed_at":"2026-08-13T09:19:56.915294Z","submitted_at":"2024-08-28T15:52:23Z","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15881","snapshot_observed_at":"2026-08-10T22:27:13.611917Z","title":"Llava-mod: Making llava tiny via moe knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.611917Z"},"links":{"cited_paper":"/paper/2408.15881","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:a080cca5197fb642e7c6120bf053e943081c66347220b740efcc95e53d489af3","observation_id":"1fb87df2-bf6a-4d24-86d2-b06f143106d1","resolution":{"observed_at":"2026-08-10T22:27:13.611917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.370513Z","title":"Towards VQA models that can read","venue":null,"work_id":"64d978f3-f881-4b58-827a-9ab5c7b66515","year":2019},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.617983Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:479c743a582df0b7e83ab503d33c54beef069bddd2cbb23b0ef7d3dadfe04c28","observation_id":"feab3b34-00d0-4463-af1b-f2373b6e3400","resolution":{"observed_at":"2026-08-10T22:27:14.376638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T22:27:13.623266Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.623266Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:c714c5ebd658856fe8f76f4d1ac9532cd039adef7ae27d7022000fcc6762e5a8","observation_id":"537f842c-2f51-4b1f-a934-71619aa3f266","resolution":{"observed_at":"2026-08-10T22:27:13.623266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T22:27:13.629155Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.629155Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:8eb4a965de7ff0e928325d314600a53099131f234bfcd20273bfce01d811da88","observation_id":"06dddca7-3899-4452-a179-9dfe1bb073dd","resolution":{"observed_at":"2026-08-10T22:27:13.629155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T22:27:13.634602Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.634602Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:157292af40e212ae543816bba08cd7ee461ade2a066ed918f98ac0230cc8ee6e","observation_id":"cc810408-1203-4a73-b879-54a5a7f7a875","resolution":{"observed_at":"2026-08-10T22:27:13.634602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14141","last_updated":"2022-08-24T16:48:09Z","snapshot_observed_at":"2026-08-14T01:47:59.454497Z","submitted_at":"2022-05-27T17:59:36Z","title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14141","snapshot_observed_at":"2026-08-10T22:27:13.640466Z","title":"Contrastive learning rivals masked image modeling in fine-tuning via feature distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.640466Z"},"links":{"cited_paper":"/paper/2205.14141","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:b66c54b5103a67bd0e7ab10aac9b17a0770d44d6284d7a89bfcb9b666b3e6d1c","observation_id":"6fd74cd9-03fe-46e4-b28b-161e108eac19","resolution":{"observed_at":"2026-08-10T22:27:13.640466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.353664Z","title":"Beyond full fine-tuning: Harnessing the power of lora for multi-task instruction tuning","venue":null,"work_id":"ebe94af2-d12c-4629-9739-71bf84a8a405","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.645663Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:881c1a3c7de6082b450223c452582965354b93d0e43c12eb93d507cc73d11bb5","observation_id":"f461571d-9743-41b5-a747-724556a9ebd8","resolution":{"observed_at":"2026-08-10T22:27:14.358827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10890","last_updated":"2022-10-25T08:07:05Z","snapshot_observed_at":"2026-08-13T16:52:58.775159Z","submitted_at":"2022-01-26T12:11:02Z","title":"One Student Knows All Experts Know: From Sparse to Dense","version":4},"cited_work":{"arxiv_id":"2201.10890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10890","snapshot_observed_at":"2026-08-10T22:27:13.832367Z","title":"One Student Knows All Experts Know: From Sparse to Dense","venue":"cs.LG","work_id":"f562b9b0-1ba3-40bd-a771-b19503b47389","year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.651129Z"},"links":{"cited_paper":"/paper/2201.10890","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:927ece59c46af1b0849b3c218e62482517063aa01c0427aeaf40f202b837deef","observation_id":"aeb84c7c-b67b-4163-8095-7d3114642c16","resolution":{"observed_at":"2026-08-10T22:27:13.840003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T22:27:13.656119Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.656119Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1898db52e2d9b31784f8c2e0a77f2067b79738b1e551db4085fb8d44c35da888","observation_id":"360e5dd2-430c-497c-b871-c338e1d837f6","resolution":{"observed_at":"2026-08-10T22:27:13.656119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-10T22:27:13.661456Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.661456Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:342f31c4a33a48a014c0f4538f6d4678dff875514ef11e7042e801982ec058e3","observation_id":"739e32ef-aa33-4050-b254-3065d0eade26","resolution":{"observed_at":"2026-08-10T22:27:13.661456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.336064Z","title":"Learn- ing from multiple teacher networks","venue":null,"work_id":"6a903135-0271-40c2-8758-b65c3df46da6","year":2017},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.667871Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:33abc49c7cf80823346d198d9469d43445454bb5916831a5aeefadd33b53f5ff","observation_id":"70e96a49-6bc9-4699-b345-d73b97b094ee","resolution":{"observed_at":"2026-08-10T22:27:14.341911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-10T22:27:13.672970Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.672970Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:c200829449ca985729aedc28ef238038190e2c3246fdd1beeae89d0020d9f967","observation_id":"99d02520-c2a3-488b-b4a0-cf37515833be","resolution":{"observed_at":"2026-08-10T22:27:13.672970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-10T22:27:13.678455Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.678455Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2aadf541bb66c3a2dd0969549e01e06d8d6ed3c3337006cba566d06c8fb4b3b4","observation_id":"44a85115-9640-4250-aeab-06739e43206d","resolution":{"observed_at":"2026-08-10T22:27:13.678455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T22:27:13.683823Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.683823Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:612bf917f570773c9dac37cba2537986ace52813b71db14819273997d951154c","observation_id":"df1d01a3-4cf9-421d-9494-3812d1d04ec7","resolution":{"observed_at":"2026-08-10T22:27:13.683823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.316664Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"b09bc625-7c14-4213-9111-db496640eaa6","year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.689128Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:18b5d32c821168c4b3d4e3be6e2489ac11faf9f8403fa877063ec5e0ec719e65","observation_id":"a5c23181-1923-488d-a002-443d8b833862","resolution":{"observed_at":"2026-08-10T22:27:14.322850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:25:52.333171Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2501.01709."}