{"as_of":"2026-08-11T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb7df7eb74082d4842ec197c831cbc672414094d58339f4232e5964c6124541f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:36:21.235533Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01540/citation-record","integrity":"/paper/2508.01540/integrity","json":"/paper/2508.01540/citation-record.json","paper":"/paper/2508.01540"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:14.734761Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:14.734761Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ae52a5970d5095bd849bea1460463db41d3fd3c3c05e24aa14f56f4a6724d5ad","observation_id":"3509e6fe-17cc-4f38-a96f-c7bc8453f957","resolution":{"observed_at":"2026-08-06T05:36:14.734761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:14.860484Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:14.860484Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:4dfc402fd5eae2e8b42274f75b7c4ba63ed68b691b28e0cafc670bb4ba3bac67","observation_id":"4107bf47-e436-4f5c-8fd6-bd4191b4c2f1","resolution":{"observed_at":"2026-08-06T05:36:14.860484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T05:36:15.006639Z","title":"A.; Awan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.006639Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:653cc7955f2a3597b6f50e9d3a9d4837a748f492f7bd7ae12b9a1289df5a0267","observation_id":"6f2ad7b1-59c7-4c4d-a721-e5c1dc70fc6b","resolution":{"observed_at":"2026-08-06T05:36:15.006639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.230053Z","title":null,"venue":null,"work_id":"84758291-6f52-4a54-a6dc-b539c0e2db93","year":2022},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.249216Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ff3f4b90c0a8a888ee89a0563255886f9da57fc03ad2394a2dbfdd3a2866ba86","observation_id":"8354bbe4-7984-416d-96f8-b20b65d1236e","resolution":{"observed_at":"2026-08-06T05:36:23.241059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-06T05:36:15.392288Z","title":"M.; Firat, O.; Johnson, M.; Lepikhin, D.; Passos, A.; Shakeri, S.; Taropa, E.; Bailey, P.; Chen, Z.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.392288Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:3ac04551f6d167e3615b98282cf04b72eeff00205ab75ba7a4e852d666668785","observation_id":"997a9521-839a-4566-9bda-ddc669f88f25","resolution":{"observed_at":"2026-08-06T05:36:15.392288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-08-10T10:55:20.865091Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-06T05:36:15.587037Z","title":"L.; and Paul, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.587037Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ab87bd348cf08692b8b732a25ea24506ac52176b8b468f7347779023af90720f","observation_id":"54d73ddc-ad49-4d92-a802-17d5dcb5f9c6","resolution":{"observed_at":"2026-08-06T05:36:15.587037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19456","last_updated":"2024-12-01T11:27:09Z","snapshot_observed_at":"2026-08-07T05:07:54.782822Z","submitted_at":"2024-10-25T10:30:21Z","title":"Computational Bottlenecks of Training Small-scale Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.19456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19456","snapshot_observed_at":"2026-08-06T05:36:22.595820Z","title":"Computational Bottlenecks of Training Small-scale Large Language Models","venue":"cs.LG","work_id":"e78ccfd9-4210-4974-840a-158efadc15dc","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.746964Z"},"links":{"cited_paper":"/paper/2410.19456","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:1057bcd00eb90dd13b0bd81f48f8d8817da3a962cb6dae7c579db47de10eccc7","observation_id":"d220843a-790f-4b94-93b2-9ab424255fec","resolution":{"observed_at":"2026-08-06T05:36:22.608519Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T05:36:15.887455Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:15.887455Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:c4596cfa16b788e37b2e4a93f726605db7ec456a0ffa7f00242fcf88daa3a0f9","observation_id":"fdf5abf0-e0bd-4f9a-bdae-f098965e3f2c","resolution":{"observed_at":"2026-08-06T05:36:15.887455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T05:36:16.008492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.008492Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:16bacee291f53bd954d467bc9330c9bb715dffad9c406209fdafa1e94dbf6f0a","observation_id":"b742f291-5502-489f-b166-d41b08f40875","resolution":{"observed_at":"2026-08-06T05:36:16.008492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T05:36:16.131300Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.131300Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:a1768173558598517c4c1523a6f10bc3a42baddfa3956e32831f0766c95d4b89","observation_id":"a759d4f8-f3aa-4161-8f46-b64515a7f480","resolution":{"observed_at":"2026-08-06T05:36:16.131300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-10T13:02:49.707705Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-06T05:36:16.252253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.252253Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:4af161316efbe209e319018f22ce350d1fceba0f2abec3b96354e02b739e0d32","observation_id":"2f5c417c-18a9-4dc0-9b18-847fb8334728","resolution":{"observed_at":"2026-08-06T05:36:16.252253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.196546Z","title":null,"venue":null,"work_id":"a587b6a2-7d93-4c9f-9205-fd837aca0fcc","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.396835Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ca7b1584628e34feaf677475728f4fa8ca207d4b15a2f2637a3a3b949c393dd5","observation_id":"ee21ce58-989d-4df0-9fc8-e76010ad85e2","resolution":{"observed_at":"2026-08-06T05:36:23.203133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T05:36:16.550704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.550704Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:550ed69d3d0654d359d86694badd0d04c2db6dd54e229d78e904c1000f18dcd1","observation_id":"bf91c920-1571-41c4-88ac-1e15fe993083","resolution":{"observed_at":"2026-08-06T05:36:16.550704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T05:36:16.705692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.705692Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:a1d870ef17bcc654af7476c7d3686c33ef2a7d6911ba39b803e1eadbb92bb250","observation_id":"5094cf2c-ae6e-4a02-b93b-d71c7eb784b2","resolution":{"observed_at":"2026-08-06T05:36:16.705692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T05:36:16.823297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.823297Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:7080e8c7e12653cae4bf388ebc26fc6c1805e02c93c98a80f47a79e8a99c4c65","observation_id":"9f2a78f9-20fd-4b6f-a7c4-36f3ba711a7f","resolution":{"observed_at":"2026-08-06T05:36:16.823297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:16.916546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:16.916546Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:86796e5f693d5ef853be1ed019e44c270735bfb2b7193c575bd0afe77ad9a178","observation_id":"fc3ad882-5ad8-4422-9638-ed4c17654ccc","resolution":{"observed_at":"2026-08-06T05:36:16.916546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T05:36:17.046484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.046484Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:255c393092a2608de652b210d8b20315484ed0abd7ae3895cb4b007b4b3ca6ea","observation_id":"beb49cf1-6177-438f-96b7-487fb8f11626","resolution":{"observed_at":"2026-08-06T05:36:17.046484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T05:36:17.214634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.214634Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:8b296edb8e3b54d6581bff7ff20c4f2be9f4caf218f1a2134dcb3125974c855e","observation_id":"d4b12cfc-f810-4ba5-b98f-1a3ff685a3d2","resolution":{"observed_at":"2026-08-06T05:36:17.214634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-06T05:36:17.378776Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.378776Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:19023475d8114b6df517588e9e03f16f3b652929abe387f79633f9b9fe99327b","observation_id":"ff91f547-a92f-4e11-9933-3f2843efc94a","resolution":{"observed_at":"2026-08-06T05:36:17.378776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.142926Z","title":null,"venue":null,"work_id":"b842889b-eba0-492b-b71e-a1d47d9178c7","year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.575878Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:29f669f0b918c353f57ac4a80c095530604ca2d169d55bb6606a88dcb581cc11","observation_id":"cec6b9c8-65b2-49c3-a151-68e7aaf1cc5b","resolution":{"observed_at":"2026-08-06T05:36:23.149836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.114875Z","title":null,"venue":null,"work_id":"b935980a-d664-4990-ab2a-b15cb5ce41b3","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.725893Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:1ca9c351090e8771adf5244ddb5290fcf7a75ef6d60dd11ecb0c0b7e5a128b3e","observation_id":"f842255c-0dea-46c9-b7ec-e60f46cf450c","resolution":{"observed_at":"2026-08-06T05:36:23.121631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T05:36:17.899494Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.899494Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:02c213aa169fbc8063ab924ba147da86e9beea208389574e143ef1ef59db4450","observation_id":"99691d76-b85b-4bb9-8efa-7e0ccdc350e8","resolution":{"observed_at":"2026-08-06T05:36:17.899494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-06T05:36:17.999665Z","title":"M.; Jain, A.; Schmidt, L.; Toshev, A.; and Shankar, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.999665Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:367bcd197294a09ee04d051732502469b4990ae6d4cab8595d51c7b87175af0b","observation_id":"931622a0-1b76-40a3-87c8-948eb6e1f4f6","resolution":{"observed_at":"2026-08-06T05:36:17.999665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-06T05:36:18.071945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.071945Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:733bee99ef007fe4e0c08bc8eafd76681fc0035745acf37695e71dca5f3cb84f","observation_id":"04379f03-058a-4e4f-a9fe-3456385065b4","resolution":{"observed_at":"2026-08-06T05:36:18.071945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T05:36:18.156872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.156872Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:e4d893b7d0052e5c870c2f5c3206b750c6842a120a80feb106e3fd97e13af40a","observation_id":"f02266ad-6a60-4fe1-b239-5f8f1b6c1394","resolution":{"observed_at":"2026-08-06T05:36:18.156872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.088571Z","title":"H.; Kamath, A.; Peng, N.; and Chang, K.-W","venue":null,"work_id":"7212085b-8c02-4665-adf1-fa16969bae66","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.237291Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:1822b50f0b3c2878e9fc3d94815b1051693d49e5aea6c8da27eccea41a145318","observation_id":"168dbd3f-8959-4949-b2c4-8fe6331c5555","resolution":{"observed_at":"2026-08-06T05:36:23.096804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00079","last_updated":"2024-09-30T16:52:51Z","snapshot_observed_at":"2026-08-07T19:42:03.090741Z","submitted_at":"2024-09-30T16:52:51Z","title":"Interactive Speculative Planning: Enhance Agent Efficiency through Co-design of System and User Interface","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00079","snapshot_observed_at":"2026-08-06T05:36:18.309017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.309017Z"},"links":{"cited_paper":"/paper/2410.00079","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:b2b2868cb21fffa120c938cbf8f40786fbab72393a2768a89d6c5c6b42b0f9d0","observation_id":"e56ac321-f401-4885-848f-3fc84bc9692f","resolution":{"observed_at":"2026-08-06T05:36:18.309017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02034","last_updated":"2024-10-28T07:40:49Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:55:58Z","title":"Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02034","snapshot_observed_at":"2026-08-06T05:36:18.365077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.365077Z"},"links":{"cited_paper":"/paper/2408.02034","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:d1aadf12c33ec729e28f103ad9d986850a29655b16ddeee2a7c7e4ebe8df02f1","observation_id":"fe8d2891-1f27-40ee-8a9b-e9f96cbd28d8","resolution":{"observed_at":"2026-08-06T05:36:18.365077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.052066Z","title":null,"venue":null,"work_id":"b82ee3a8-bcf1-4182-84d5-a49ad5b26e8d","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.432523Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:787a4e48f0a3f914b382290bd292610809f99a4bd11ef1bdfa68599cfacd1255","observation_id":"d827b38b-0df4-4468-88e2-93219cf436a5","resolution":{"observed_at":"2026-08-06T05:36:23.069223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:23.017224Z","title":null,"venue":null,"work_id":"da7986b7-3aab-47e3-8a09-fcc309e62c19","year":2014},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.482100Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:02ec7f6909b760c6f3262313eabb5aa0f2ffccecb77b8edf97132b95f026a116","observation_id":"8e3065cc-a1d9-4c35-b585-c887a0bebd03","resolution":{"observed_at":"2026-08-06T05:36:23.021894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T05:36:18.580953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.580953Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:1158e9439b58e52e41c6126a7468931e862d30dee61aee3959e680e4b70d05be","observation_id":"1f110178-b429-413f-a5fc-6688fa611a17","resolution":{"observed_at":"2026-08-06T05:36:18.580953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:18.666785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.666785Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:8d6a5e987d79eb2073d9bf1c7cbcbc20abbd7b76105f6f827ac3dfd7fb074069","observation_id":"7e9c12d6-0d9a-4c28-8714-fb48617210fe","resolution":{"observed_at":"2026-08-06T05:36:18.666785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20041","last_updated":"2024-07-05T07:18:42Z","snapshot_observed_at":"2026-07-06T17:52:58.714773Z","submitted_at":"2024-03-29T08:26:53Z","title":"Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20041","snapshot_observed_at":"2026-08-06T05:36:18.779333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.779333Z"},"links":{"cited_paper":"/paper/2403.20041","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ce2018ee643f81e031c835db94b288c6dff2b7e1805604b65d7d36e2f00d6976","observation_id":"4d74209a-9cf5-4e68-97fb-7456a785e78c","resolution":{"observed_at":"2026-08-06T05:36:18.779333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-10T13:01:53.292743Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-06T05:36:18.864386Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.864386Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:8f5891d6a33bd36d3aae807d474f696689cb0fa8e0b8c9a899ea6fc3d32665bb","observation_id":"5abc18a0-57c1-41e4-9b75-a1c7165fae67","resolution":{"observed_at":"2026-08-06T05:36:18.864386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:18.949544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:18.949544Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:d4c4673e6abf6b389407d909e0c18a29d095c75aed87e997ae6522af706b20a7","observation_id":"af964230-1ca9-4adf-8b52-3362aa47d2c6","resolution":{"observed_at":"2026-08-06T05:36:18.949544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.941350Z","title":null,"venue":null,"work_id":"c473220f-bee6-4452-9301-72a064a607c8","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.055602Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:7a6ee695190283b954e4acff6d36782509fa72cfd58d550b9eb57f4a2ba40046","observation_id":"b8ca1f5d-f3fc-429d-a9ff-8e258dfbf45e","resolution":{"observed_at":"2026-08-06T05:36:22.955843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.915160Z","title":null,"venue":null,"work_id":"89189b46-72b5-4db6-b5ba-a14e7a658853","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.221480Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:df223082042e2434b423e783c49a4204bbdaba46a3a7c1f403c85eb7f3ec8d9f","observation_id":"6420b49e-5ddd-4161-a852-8fe376e436b7","resolution":{"observed_at":"2026-08-06T05:36:22.926566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T05:36:19.341740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.341740Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:fbae4763ecee6c0443849fdef2440801806ac06b858bab84168df9b87068708c","observation_id":"cdf3d3c9-7768-4d90-a61e-bf7e1904a373","resolution":{"observed_at":"2026-08-06T05:36:19.341740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:19.420247Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.420247Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:4d22c5473f587dd9dca63d292c2c8aef06dedb0bce43a45097386afb93a66b4c","observation_id":"16851500-9e0d-433d-a0a2-3a6a0604864e","resolution":{"observed_at":"2026-08-06T05:36:19.420247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-06T05:36:19.512240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.512240Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:03556b0ee5c9453364c70bbba942e7c6431282979578b9ba7bd34ecc3da3d868","observation_id":"dcae26e5-9d74-4f1b-b725-9d1175c24896","resolution":{"observed_at":"2026-08-06T05:36:19.512240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T05:36:19.605928Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.605928Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:9d7b91e557f1c55f8f50df3969d276bedcbd6253439921c7801b7dd3fc7d6bc8","observation_id":"f482c604-dbed-4c4b-a88a-e2bfae8f60fa","resolution":{"observed_at":"2026-08-06T05:36:19.605928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-04T22:40:20.902372Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10640","snapshot_observed_at":"2026-08-06T05:36:19.716602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.716602Z"},"links":{"cited_paper":"/paper/2411.10640","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:2a7268771686085098882cb45b918c0c2c3ed457c0e042816c4bf8bca5c17a8a","observation_id":"76420909-a476-4ec6-8430-31d05aa5cc23","resolution":{"observed_at":"2026-08-06T05:36:19.716602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-09T05:13:18.023230Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-06T05:36:19.867128Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.867128Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:25db3f45491a735955fb9820c27d2f45c2fc5fa4cc3d06d4dcbc342f17aab1ea","observation_id":"cf96d5d1-f44a-4e86-b065-e6a114834a41","resolution":{"observed_at":"2026-08-06T05:36:19.867128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-06T05:36:20.025302Z","title":"B.; Lozhkov, A.; Tazi, N.; et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.025302Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:a0994440b88f182541aa3989a2fac0d4583799d42ed58b8e25ebf1fd024eb6a1","observation_id":"5a8c0152-c4cd-4521-b86a-ea08825139dc","resolution":{"observed_at":"2026-08-06T05:36:20.025302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-06T05:36:20.191131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.191131Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:0241c49e146acec61c9084d6abab7da3c90018ffb41d7771bcb7c1c13a327657","observation_id":"340c3a01-ac8a-4fda-9dd5-eb288decbba2","resolution":{"observed_at":"2026-08-06T05:36:20.191131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.870746Z","title":"H.; Cao, Q.; Horton, M.; Jin, Y.; Sun, C.; Mirzadeh, S","venue":null,"work_id":"3ad15fa0-8c86-4b03-9e38-c8724531f710","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.282045Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:26284ddc24b7cc9e8ea3ca7bde069c78bc998f3f295d8ff346f79f1a9c7d7128","observation_id":"2e9096e5-a688-4227-b0e2-f1970f4eeb9d","resolution":{"observed_at":"2026-08-06T05:36:22.877808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T05:36:20.402653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.402653Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:edc711ecdc189f686a25232474f95b5d5c2e5f61df653ec95eea790299b286f5","observation_id":"03bac653-3936-4554-bc9b-68a7324d64ef","resolution":{"observed_at":"2026-08-06T05:36:20.402653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-08-10T10:16:43.623455Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-06T05:36:20.568916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.568916Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:44bf15b617e00e2b2278570f1e293bf031f93b5523cd3efe272caf3f3ff50ca4","observation_id":"6e791c27-2820-460d-9d6f-b51d36decc48","resolution":{"observed_at":"2026-08-06T05:36:20.568916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:20.695127Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.695127Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:e89a40eda0f08f06c53d4a909be485d5e95926a0cf2cee8925d33d73e7e614b4","observation_id":"fb4932a0-a3c4-4001-8fc4-5405e72c1adf","resolution":{"observed_at":"2026-08-06T05:36:20.695127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:20.806605Z","title":"J.; and Yan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.806605Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:bcb391f80d5821a052387fc5ce5bc41931592a1ffe9f1de63120c26d5a0dcb2a","observation_id":"9f396a20-9baf-49e2-9c7e-c2c8924d86c4","resolution":{"observed_at":"2026-08-06T05:36:20.806605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-06T05:36:20.951429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:20.951429Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:72a068cb0d28a539d48a6fff309c1b750f0b0a1224938efcf07b8c1f5f2ac46a","observation_id":"bcf31caa-61fe-4cf8-8152-0b803eaec2a8","resolution":{"observed_at":"2026-08-06T05:36:20.951429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T05:36:21.049168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.049168Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:af9de6da27a9010954ea172584e94241c8f4d2d7e5ee1d586e2cba22e8c92f9d","observation_id":"204367c9-8c6e-4356-8b10-1497e7e306f2","resolution":{"observed_at":"2026-08-06T05:36:21.049168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.810094Z","title":"C.; Yang, J.; Yang, S.; Iyer, A.; Pan, X.; Wang, A.; Fergus, R.; LeCun, Y.; and Xie, S","venue":null,"work_id":"743712d0-7a5d-48a1-9978-328f97aec4a9","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.078411Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:107a52eb2ff8703313f34d6aca7b217be14cb4fc02f72d3aa0c633d95e251c2f","observation_id":"09744846-b49f-4163-ac75-237c81675511","resolution":{"observed_at":"2026-08-06T05:36:22.817175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T05:36:21.086476Z","title":"C.; Yang, J.; Yang, S.; Iyer, A.; Pan, X.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.086476Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:74c088e96e1f07c5bfdcdadfb6881eb6ef8fd00e63f948c05f3afb526954d438","observation_id":"035bffb9-8d16-4026-bd1b-4c5e03287061","resolution":{"observed_at":"2026-08-06T05:36:21.086476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:36:21.095817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.095817Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:8ed34388197e0a2c299d3970a7ed856515ae028acc41e96ebf9e13d8e68f7fa2","observation_id":"af17a881-ca72-412c-8b27-d32eca853e68","resolution":{"observed_at":"2026-08-06T05:36:21.095817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T05:36:21.108741Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.108741Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:5e53b564c2f9435ec573a47b3996958217aa725376c01b37f29cfa11f6ef1aba","observation_id":"7affba21-a93b-40e3-a295-dde3a9805345","resolution":{"observed_at":"2026-08-06T05:36:21.108741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.783054Z","title":"H.; Wu, Y.; Le, Q","venue":null,"work_id":"09ecb9b4-e4c0-4917-817d-c1b2754fc0b9","year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.117062Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:897fd292b156a01e8351191f5fffd229a19a3402b73dff436b9de0df97f061bb","observation_id":"bbc1fc66-c4da-4a1a-95e0-cf6b897993fc","resolution":{"observed_at":"2026-08-06T05:36:22.789437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T05:36:21.122527Z","title":"F.; Alabdulmohsin, I.; Parthasarathy, N.; Evans, T.; Beyer, L.; Xia, Y.; Mustafa, B.; et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.122527Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:626bd820a4304b0bc2b871c8f3bb0826538078422447f6b6db9ef2cefb19461e","observation_id":"c1bb5954-51c3-4ae1-a02b-6b51003b0a03","resolution":{"observed_at":"2026-08-06T05:36:21.122527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.758476Z","title":null,"venue":null,"work_id":"55ece910-146b-4174-9879-a25c971df79c","year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.127917Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:8b93e4c59e979ce87ad8c78d670281203fd9724863f44530dff18ce48d56f8b5","observation_id":"9701cd37-bc72-4fbe-aab4-75211c41a85a","resolution":{"observed_at":"2026-08-06T05:36:22.765889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:36:21.132522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.132522Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:7388706c08240757ee5c63ecafd2395dc430d0de291f816e2bbb96495a3eca97","observation_id":"9fdfb4da-b154-47ef-9913-30c37e565476","resolution":{"observed_at":"2026-08-06T05:36:21.132522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00088","last_updated":"2025-03-25T09:27:16Z","snapshot_observed_at":"2026-08-02T17:17:30.860461Z","submitted_at":"2024-06-25T08:38:38Z","title":"T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00088","snapshot_observed_at":"2026-08-06T05:36:21.140462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.140462Z"},"links":{"cited_paper":"/paper/2407.00088","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:cb8af302faa1120db182eae484eeb8d99f05d1bd3b002cb7242a1dc7f5988854","observation_id":"1bec38ff-b4af-4ab2-98ed-3816e185f836","resolution":{"observed_at":"2026-08-06T05:36:21.140462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-06T05:36:21.148753Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.148753Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:c3bb98258169314a79adb0dd5d2c90922dce1da80a827955dcdae5c493bb9919","observation_id":"726c944d-d1f8-44ed-8119-4f8b9ca0bc80","resolution":{"observed_at":"2026-08-06T05:36:21.148753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-06T16:06:48.213787Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-06T05:36:21.155515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.155515Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:9eaa87d688896e77d5d3b583725fffc0f2854193c3c7836e48a5747225ad5b6a","observation_id":"dbb96f30-34c4-438f-addc-dc9902738ff9","resolution":{"observed_at":"2026-08-06T05:36:21.155515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T05:36:21.163843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.163843Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:a21c32c387983a5befdd9da1ef634ea1f9b3603ba1c60eac91b53dcff4b9e318","observation_id":"fbdfc907-9b57-400a-91e1-9337da8c6fee","resolution":{"observed_at":"2026-08-06T05:36:21.163843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:36:21.183605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.183605Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:85dff1bd60cee65c705863d1da6ac12a3fcfb21a2e8f4ee830b4b0ddadd92ce9","observation_id":"6e13913e-690f-415a-808b-5dd2ad160b16","resolution":{"observed_at":"2026-08-06T05:36:21.183605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T05:36:21.199932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.199932Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:ecc4ca0df3fb3ef368b002da57bb63504d60a0efea65f9e2856ce1520671467c","observation_id":"1b1d00b8-d9ea-4111-95b0-e46810108f96","resolution":{"observed_at":"2026-08-06T05:36:21.199932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:36:22.734314Z","title":null,"venue":null,"work_id":"9fd3ac5c-df10-449b-b337-a0a6896a57fe","year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.212688Z"},"links":{"citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:245094acc47f149b826018e23b52ba63faff02428d7d7cf25e22797da409c56d","observation_id":"47ecbe81-0a8c-43db-871f-ab1f316f792c","resolution":{"observed_at":"2026-08-06T05:36:22.740875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-11T06:10:10.405420Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-06T05:36:21.221692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.221692Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:0178c5f5111ae97ded0ac0c73e7332960767e995cddc59badf56d8379035facc","observation_id":"aa0571e1-fee6-4f6e-abeb-7fea0f01e71d","resolution":{"observed_at":"2026-08-06T05:36:21.221692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T05:36:21.228925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.228925Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:6c09b56fc6a095aca935a5c19d8c382feeec333cc2ec2980ce90f95b9650544b","observation_id":"3880fc57-0d21-4329-ad7d-e5250514dd13","resolution":{"observed_at":"2026-08-06T05:36:21.228925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T05:36:21.235533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.235533Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:0321f84014d20bcb052396244adef1b029ef72181fdcd1565e95aa95e9edb972","observation_id":"4c98efeb-8b81-40eb-80e0-7bc001648977","resolution":{"observed_at":"2026-08-06T05:36:21.235533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:50:30.914774Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2508.01540."}