{"as_of":"2026-08-14T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a6bc44f17f8f8e31a184edec531f3630740722d36460289504e9d2da1365ba9","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:42:12.664774Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:32.873352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.114920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:f739bd0f1082186005bf1349e1fcef2748c67c6f1ae2b190d94abf75b61701d1","observation_id":"32dfa201-5a44-4629-935a-341775b2f928","resolution":{"observed_at":"2026-05-16T11:39:22.527639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-08-13T17:51:12.532194Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:50320503ca7b3df4946a5107ea232a76173011c392eba6c93a6260a3dd796914","observation_id":"4a5a7488-3a23-49d7-8382-328a111d4aa5","resolution":{"observed_at":"2026-05-22T14:21:39.710173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T13:20:32.873352Z","title":"arXiv preprint arXiv:2501.04322 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23830","last_updated":"2025-05-28T08:38:39Z","snapshot_observed_at":"2026-08-14T03:33:47.454364Z","submitted_at":"2025-05-28T08:38:39Z","title":"EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:32.873352Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.23830"},"observation_digest":"sha256:de528b9124bf92748ca48e0a806e4bc6e76991c98d0d5b85c78b5b6455841d3e","observation_id":"cf10a8ec-9ea4-4941-9797-345210f4ae62","resolution":{"observed_at":"2026-08-07T13:20:32.873352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T12:37:48.199482Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.199482Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b7c9efbade37dc5a046b8774f95be08f3272c460a6e180b36483bfb0d8b65910","observation_id":"879f13ae-d0b9-4b5c-a844-38f843aaf72a","resolution":{"observed_at":"2026-08-07T12:37:48.199482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T05:26:47.205836Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.205836Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:ffa07d63bc15602035fe31f5acf2ebb99fec7d6e2204b8816f9db6020b2bcfc9","observation_id":"b049d93d-4725-4e24-8888-2c87fa20c840","resolution":{"observed_at":"2026-08-07T05:26:47.205836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T00:23:53.436448Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-13T14:32:10.685104Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:53.436448Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:9e269121bae19f7d9a3a68fe4af5a13ee4e97b2db07a2d9e904e63edaf247d01","observation_id":"16915555-55e8-4406-84dc-2fad6b5f7017","resolution":{"observed_at":"2026-08-07T00:23:53.436448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-06T21:27:40.633432Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-12T05:33:56.515699Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.633432Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:ff91e18cb16cd06d977bc1d85afc02c6c24778348f34ecba026bec7ac615b518","observation_id":"7305e160-f785-41c6-8060-27508a49775c","resolution":{"observed_at":"2026-08-06T21:27:40.633432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-06T20:45:08.886712Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-13T03:34:39.503239Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.886712Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:9211447f4b08b1372ae4071ae532c271f93b19c011db09922dea9e3756e0e31a","observation_id":"2ba8ed5f-3bb5-4fc0-a0b3-d68040702d1a","resolution":{"observed_at":"2026-08-06T20:45:08.886712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:7041f79e3124bc15fb2a0fc464429e6d0195136c26e29b10d37fa4bc8897bf33","observation_id":"37685f8e-c4ee-4ad8-a34f-d2baf8251d9c","resolution":{"observed_at":"2026-05-11T08:30:57.166141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:e24e19dc1d86052919eee30e400c0429d0c11cfd343d1da8afc679f662a21600","observation_id":"dc1f5f79-6025-4147-93c1-4f3c8fc73760","resolution":{"observed_at":"2026-07-03T04:27:37.116550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04322/citation-record","integrity":"/paper/2501.04322/integrity","json":"/paper/2501.04322/citation-record.json","paper":"/paper/2501.04322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.382246Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.382246Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:1f7ecadf774735bdad2e14ba588fc6468b89680550fc2a7d413bbd335888da87","observation_id":"1d451084-42cc-4037-9506-b6de5e913866","resolution":{"observed_at":"2026-08-10T21:42:12.382246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.387018Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.387018Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:9ffa3d230b1cadc54bf1eb851a6158c795474f39b460eb5762275d0769f0ecb5","observation_id":"bf5c3248-f3e2-4ea4-af2b-df9bd936d500","resolution":{"observed_at":"2026-08-10T21:42:12.387018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T21:42:12.391244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.391244Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:6482d930b10c41d6cad7e4a7d11df81614eeaf43978855371a8f39944c564d8f","observation_id":"4bf881bc-0e99-4caf-bb61-9adde70df0d8","resolution":{"observed_at":"2026-08-10T21:42:12.391244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02358","last_updated":"2022-05-27T15:44:26Z","snapshot_observed_at":"2026-08-13T17:40:11.285124Z","submitted_at":"2021-11-03T17:20:36Z","title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02358","snapshot_observed_at":"2026-08-10T21:42:12.395402Z","title":"K.; Aggarwal, K.; Som, S.; and Wei, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.395402Z"},"links":{"cited_paper":"/paper/2111.02358","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:ed507dbcb9462fa6807f6041eb777e66fadc999283af8bef4667cd4b273c3553","observation_id":"fc827713-8028-4d87-be55-0c7700e615c6","resolution":{"observed_at":"2026-08-10T21:42:12.395402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-13T04:08:50.424750Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-10T21:42:12.399199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.399199Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:0b72e14881caf6c180b228feb65d4aff22448d6baabf8a3f72c2df98e4fbbeaf","observation_id":"a7c42f80-daee-48be-a582-c3d128abda0a","resolution":{"observed_at":"2026-08-10T21:42:12.399199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.402955Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.402955Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8df4845fee9585462c7c096488f06d95bfbbf0367d9671ffc00f20fb27c740f9","observation_id":"528ffb5e-b3de-46df-bebd-62c3cbae8d91","resolution":{"observed_at":"2026-08-10T21:42:12.402955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.350618Z","title":null,"venue":null,"work_id":"2f4659e2-788b-4db1-9b4d-ea4b5aa476a0","year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.406540Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8f1f320e9d217c22887aef435db9464f623cfd8b47f878bcc6de754cec57c203","observation_id":"a7885e44-5241-40fd-943e-981a12235f99","resolution":{"observed_at":"2026-08-10T21:42:13.354011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.409904Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.409904Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:167203d00948ab20c36f34c0e2fe473c07bd48a488b36dd8f0767014e463c99e","observation_id":"9ba9f3fd-6113-4c60-8bf7-7f067e8d82c6","resolution":{"observed_at":"2026-08-10T21:42:12.409904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-10T21:42:12.413888Z","title":"H.; Chen, S.; Zhang, R.; Chen, J.; Wu, X.; Zhang, Z.; Chen, Z.; Li, J.; Wan, X.; and Wang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.413888Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:f239327cbab9af9b185d91f2f16c2ca85631f0399ef11f7ed5c026ed20701ccf","observation_id":"997d9897-a14b-4941-969f-f27c0cfdddba","resolution":{"observed_at":"2026-08-10T21:42:12.413888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T21:42:12.417609Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.417609Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c9d5cf95b777b5f371b1a33b596651d570985fa9ce57c6c193e44547bbde99ca","observation_id":"9530c575-dd45-4a9b-ab18-c2c1da59390f","resolution":{"observed_at":"2026-08-10T21:42:12.417609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-10T21:42:12.421641Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.421641Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:25b29b814f82d242bb23800fa8e8af0ec5962db2fcddca445557278a2f9786f4","observation_id":"a901c482-064d-4f32-9757-53c9a8d624b0","resolution":{"observed_at":"2026-08-10T21:42:12.421641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-10T21:42:12.425313Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.425313Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:a248bd9d2665b058f2c681ad129cabc95d75f61fde9812cf7043d046d2a28773","observation_id":"4470e77a-389d-44db-b612-8055e91ebebc","resolution":{"observed_at":"2026-08-10T21:42:12.425313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.429121Z","title":"E.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.429121Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:9ceadf2259ca715ca7e0c4f7008540c972f7f1e19bcc79379c6ecaac1ec204cf","observation_id":"86c3582a-f8f6-4936-9dc4-3d30d16c36f5","resolution":{"observed_at":"2026-08-10T21:42:12.429121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T21:42:12.432690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.432690Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:3483004aa704fcb37b4e74a5d90baf935faceac45a559c9d478e68026974a4fd","observation_id":"a5ae5a6c-25ed-4757-b29b-542d4ef1dd2b","resolution":{"observed_at":"2026-08-10T21:42:12.432690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-10T21:42:12.436308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.436308Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:fd073fcf49aaec6bb99d9be304719c5174c7160fb87f37b562028d9aa10b9f46","observation_id":"b88f286f-57d3-40a1-8fdd-ad67ddade48e","resolution":{"observed_at":"2026-08-10T21:42:12.436308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T21:42:12.439984Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.439984Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:834062ba9e632a90ec8dd94bfb121749fdc31cb209806e305543fa9e44336a4b","observation_id":"caf30f46-7b69-4c04-a4b5-4d0d4cc46265","resolution":{"observed_at":"2026-08-10T21:42:12.439984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T21:42:12.443838Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.443838Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:48269e62ac4572727a3db7f7070f985f25c42698b78708fc0be749bd2b17afdc","observation_id":"700667b4-e726-457f-a950-2d447c765204","resolution":{"observed_at":"2026-08-10T21:42:12.443838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:42:12.447197Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.447197Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:ef4cec09f6f78fa81e2bea4deaa637b38db126bc8edac5c7e4e203a631cf0cae","observation_id":"0441bc01-05c1-4d5a-994f-afa660cf4869","resolution":{"observed_at":"2026-08-10T21:42:12.447197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.450585Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.450585Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8656fe85746511d0a72a88bb836a4bf6026e55ae517d73725ac1b3b2643e443a","observation_id":"76c5eea4-2ad9-40eb-b291-df0bfe4efdc6","resolution":{"observed_at":"2026-08-10T21:42:12.450585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T21:42:12.454034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.454034Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:44e6a1002452872f3588c2e9950b375c76a92aa5c7f13c4b45796416d3e16e8e","observation_id":"2cacafbb-0278-4263-a8ef-92ebf4c6dd73","resolution":{"observed_at":"2026-08-10T21:42:12.454034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-10T21:42:12.457573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.457573Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:444c2a95a8824bc28817c18c4b7d18ed983bb09c710358040bd9a48363149680","observation_id":"37d4c636-ccab-4782-a2c4-7578d70dd9cc","resolution":{"observed_at":"2026-08-10T21:42:12.457573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.461362Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.461362Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:75cb89d4e70add8039613a57835a39277efea59753673002f96cff47a4dd5d88","observation_id":"b2f8134f-0f81-4bca-88ab-a1eb0cb86a07","resolution":{"observed_at":"2026-08-10T21:42:12.461362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T21:42:12.465022Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.465022Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:0080d7f31f12b8cc8f5c7e14e6c2012742bb215d56a479e9c6df12a38450db6c","observation_id":"abbbb94c-7da2-4203-939c-82dd5abcbb8c","resolution":{"observed_at":"2026-08-10T21:42:12.465022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T21:42:12.468709Z","title":"J.; Shen, Y.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.468709Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:d6334a6effa2151d1456b6d7c4f7654b14e72e86462e0003207fc6d7674eab0b","observation_id":"ad1b4f3d-cac2-4f07-a91c-34249e7e90b2","resolution":{"observed_at":"2026-08-10T21:42:12.468709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.313990Z","title":null,"venue":null,"work_id":"1d31713c-00a0-4898-89af-ac6f78406b17","year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.472621Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:ea6fb4605b2ae77e94561c95cff7c61b68f8885b596ce35ba7e0f1e2d8477c7d","observation_id":"a4e5d319-2795-4d7e-9714-730c70a1af34","resolution":{"observed_at":"2026-08-10T21:42:13.318039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.303583Z","title":null,"venue":null,"work_id":"848c3da4-be96-44aa-bf5b-52f5f12f2989","year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.475913Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:304023fc276552ee71e9a893141a24875cc621b40f897fb84c7dfe3bc5792597","observation_id":"f9c7fd53-f26e-4f6c-9628-16ce04ee39a6","resolution":{"observed_at":"2026-08-10T21:42:13.307006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.479477Z","title":"A.; and Manning, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.479477Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:b31fd76bde2842c7e5934797079ad92820563c67c82c429676a2ca64804895d2","observation_id":"7adc87b0-0f60-48d8-888b-83f38c188b61","resolution":{"observed_at":"2026-08-10T21:42:12.479477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.287229Z","title":"A.; Jordan, M","venue":null,"work_id":"04dbe33a-d813-427d-be16-1576a40b7453","year":1991},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.482825Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:4270eb4acce3a7f39f7a53df69692257b08e879e0ae3e471e173aa50ef7c9925","observation_id":"f8d0eac5-fa87-4c8c-9a9a-e77baf23af2d","resolution":{"observed_at":"2026-08-10T21:42:13.290654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T21:42:12.486505Z","title":"Q.; Sablayrolles, A.; Roux, A.; Mensch, A.; Savary, B.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.486505Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:6f55f1da4eb398a29379880506abddfc2b71d9080e1c7d6cdc6317a5c45dfa44","observation_id":"5bd11329-9335-4a22-b030-4b83e987769e","resolution":{"observed_at":"2026-08-10T21:42:12.486505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.276785Z","title":null,"venue":null,"work_id":"898cfc16-0d3e-4e58-9084-c311f8832aa1","year":2018},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.490016Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8e0d27d245ed574cc7c5d8d04fd5cb7301ed9ee554bedff53594eb598f788e4d","observation_id":"19e2f290-ecaa-496b-8802-6554e1b91693","resolution":{"observed_at":"2026-08-10T21:42:13.280387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.266198Z","title":null,"venue":null,"work_id":"01ef64da-df73-410b-a82f-25a5aa8c24f2","year":2016},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.493534Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:6ca19500b7a1852804d36f38ff23ecc4946acd106d5d8fb32d53866014fc4d6b","observation_id":"7e0c649d-f098-4509-a60b-38a6120a5777","resolution":{"observed_at":"2026-08-10T21:42:13.269815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.254884Z","title":null,"venue":null,"work_id":"adb599be-3bd4-4a45-9ee2-d9a1bf806c4a","year":2017},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.497177Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:9b14df9a2086368a23fceab1ae69f6f2c3d97d0b98c863268c8f63bf1975c574","observation_id":"7976cf8b-2fc9-45a8-bc16-fe823f9812cc","resolution":{"observed_at":"2026-08-10T21:42:13.258486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-10T21:42:12.500975Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.500975Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8d7e3fd9ff7a9979019661b97659fbf248f4b583ac2d5502da81cc3f0450c234","observation_id":"885830d2-d653-44b0-a230-d18c1a682fba","resolution":{"observed_at":"2026-08-10T21:42:12.500975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-10T21:42:12.504611Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.504611Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:b6da3c5b91bad0817b3788e513e4c8ad677f265eeaf2d4be58bee15245629c62","observation_id":"3ed641db-35ae-4c7d-9311-d916a6dde100","resolution":{"observed_at":"2026-08-10T21:42:12.504611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T21:42:12.508338Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.508338Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:0780edd5c03f90fa9f21b9ab6f5c709118d2f27b9b5609c09f4cb908037982ef","observation_id":"bd1231c0-5bab-4062-a9a6-4704c070bda8","resolution":{"observed_at":"2026-08-10T21:42:12.508338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T21:42:12.512239Z","title":"X.; and Wen, J.-R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.512239Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:1838179931e186d53896ea4bdce085a0f56e2ef6c51b9166975232c6e35f280d","observation_id":"07f54a43-9a51-491b-9b86-305f3d3c0dd2","resolution":{"observed_at":"2026-08-10T21:42:12.512239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14839","last_updated":"2023-06-13T06:31:46Z","snapshot_observed_at":"2026-08-14T04:55:39.577329Z","submitted_at":"2023-05-24T07:43:29Z","title":"PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14839","snapshot_observed_at":"2026-08-10T21:42:12.516256Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.516256Z"},"links":{"cited_paper":"/paper/2305.14839","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:a9c8cc71359623fab64cb5b6d5a9cb90df90bbe30f98513af3b7232d66ecb4dc","observation_id":"1cfb2fd5-93dd-4eff-8f0a-6d59db422156","resolution":{"observed_at":"2026-08-10T21:42:12.516256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T21:42:12.520221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.520221Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:b85316c98ea834afefd2e2288c5190a8ad8e6ac5c4ecdc62b76dd68e1023b2c9","observation_id":"0fcfa30e-461a-456f-80cb-a501101b0056","resolution":{"observed_at":"2026-08-10T21:42:12.520221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-10T21:42:12.524131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.524131Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:4d6b6039e955d11a5cb7870f70b4376233e856ccadc79d5e1fd3aceea77fb279","observation_id":"659cb86b-cd8d-4705-93a9-be3602a48f78","resolution":{"observed_at":"2026-08-10T21:42:12.524131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.527975Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.527975Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:d66e51e70041b0e936366293cad784653255d387e3647632a75c0714e65711c9","observation_id":"877c007d-f680-4b9a-a2be-3279482ffce6","resolution":{"observed_at":"2026-08-10T21:42:12.527975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T21:42:12.531526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.531526Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:726f16d47bc6d9925925cb859a2a47d3b53e136b2f449bec8a96fde65a9a25a6","observation_id":"d78fc038-9e6d-4f6c-ae73-d089b9a8eebb","resolution":{"observed_at":"2026-08-10T21:42:12.531526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.237943Z","title":null,"venue":null,"work_id":"11f7f17d-a3c4-45dc-92b4-4abc8e3082e8","year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.534957Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:41a38c9bf0f0818c2b806af211271d90bd90ad875636750e20a7af8618437511","observation_id":"478b0675-ae22-4741-8e1c-dbf4ba481a6e","resolution":{"observed_at":"2026-08-10T21:42:13.241708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.227657Z","title":null,"venue":null,"work_id":"e37addcb-2689-4fa6-986f-4d3050cc40b2","year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.538458Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c0fec27c19f3ad1fa765aefd92bdde3dea9728bb25c7d9ad072b4b53beda3b45","observation_id":"ae1873cc-32ff-43e8-b359-f5317a84774f","resolution":{"observed_at":"2026-08-10T21:42:13.231186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.216732Z","title":null,"venue":null,"work_id":"237e2b66-9a30-4fb2-b20a-e8d200cd65f5","year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.542000Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:3e07f2e2f88b839e765d5603afdaa22bd8d9224462f9473250b2198e64a055a5","observation_id":"e243fd5d-125b-4c12-a862-c734d38cadd9","resolution":{"observed_at":"2026-08-10T21:42:13.220323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T21:42:12.545211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.545211Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:4caee38ddf082ea73c884bb6205797fb3cc652225771fa68c820642171b3651f","observation_id":"863ae401-a94c-4bbb-a37e-8cc954b8a695","resolution":{"observed_at":"2026-08-10T21:42:12.545211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.205699Z","title":null,"venue":null,"work_id":"cbd17ee2-67fe-4447-8dd4-3ef9c8e5cf95","year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.548742Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:6545a203bc565263139b0da0116551530365d73dd175daa0543f49f07eed6da6","observation_id":"405653a7-573a-4a1d-b89b-fab4481abda2","resolution":{"observed_at":"2026-08-10T21:42:13.209257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T21:42:12.552134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.552134Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:2fd3e1b3f1cafd0d5c0cbf3aafad4d48c69233525cecbedb7b0b61c6260a13a4","observation_id":"0a5a2dd0-3111-45e4-bb5d-bff582f7af49","resolution":{"observed_at":"2026-08-10T21:42:12.552134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.555718Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.555718Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:2ca340250dd12a25d5afe3189d492475b856b983a6656a010e282c05ef41da10","observation_id":"c73def13-7609-4afc-955e-af8eadc2a16c","resolution":{"observed_at":"2026-08-10T21:42:12.555718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-13T17:46:06.390586Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-10T21:42:12.559437Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.559437Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:f05bc5430404795f85a7519e775cf5e45bd60a3cdc024979b72802c669fd6e57","observation_id":"cdb5bf3e-7504-4e92-a1d0-eb1054360fc5","resolution":{"observed_at":"2026-08-10T21:42:12.559437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.563030Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.563030Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8f169cb97e42b568ec1c054f4972a0907739f725befc60d9c56c47e1ad9c3287","observation_id":"af157eb4-a97c-49ed-b00a-ced4d7fd18f6","resolution":{"observed_at":"2026-08-10T21:42:12.563030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T21:42:12.566224Z","title":"X.; Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.566224Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:eb594743397232dc1e9147d851dff94324051bff9ac4a80f3ccb0934b8ac9667","observation_id":"28e832ca-d096-41d9-99da-680809a141b6","resolution":{"observed_at":"2026-08-10T21:42:12.566224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-08-14T18:36:49.421687Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-10T21:42:12.569949Z","title":"B.; and Lapata, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.569949Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c055fdcfb25f3a4f57656f87faa31bd9885ac5a7acd4d2a8ae81450e2c8c2830","observation_id":"e9325067-30ad-4a22-9d42-bbda19a4be4d","resolution":{"observed_at":"2026-08-10T21:42:12.569949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.573669Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.573669Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:d997996b327f47caf70e6a971778376d9290cb141227f01e341bb9f54eb44d33","observation_id":"9325ae1c-917e-4426-a23c-fe7931bb8bfe","resolution":{"observed_at":"2026-08-10T21:42:12.573669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T21:42:12.577043Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.577043Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:32783828797a4dfbc12e0f2e6f71aa1dacf6def8bc5a0af2ff860e4d65781a9c","observation_id":"a3b5a508-74b2-47e8-a999-8b76bb15d4f6","resolution":{"observed_at":"2026-08-10T21:42:12.577043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-06T21:17:51.553405Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-10T21:42:12.580841Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.580841Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:d40ef12d317272f24247f7e07878c565a73559326f35f24a9dc80b1c04766880","observation_id":"dd055cde-c53e-4c06-a375-28b75faa5448","resolution":{"observed_at":"2026-08-10T21:42:12.580841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05974","last_updated":"2021-06-10T17:10:56Z","snapshot_observed_at":"2026-08-13T19:05:40.642938Z","submitted_at":"2021-06-10T17:10:56Z","title":"Scaling Vision with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05974","snapshot_observed_at":"2026-08-10T21:42:12.584558Z","title":"S.; Keysers, D.; and Houlsby, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.584558Z"},"links":{"cited_paper":"/paper/2106.05974","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:71671e5ec9fe5def8947d95228048dd42294ff00d400efb15025234d7014c6e4","observation_id":"6223f476-e130-40ef-91c3-5d91b9e0a66e","resolution":{"observed_at":"2026-08-10T21:42:12.584558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.588460Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.588460Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:933a7635af6ce8c36796cab2660d31c7ae5967aaab963750eedd43a308433ca4","observation_id":"019d9510-af28-4f28-a226-627b9d1d6097","resolution":{"observed_at":"2026-08-10T21:42:12.588460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-10T21:42:12.592020Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.592020Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:e90abd183ab58ba4c3ff34240d0a634b7f88c7843494cede6f8f2e7295f7edc5","observation_id":"dea6e367-469f-419d-a28a-4e382e86d29c","resolution":{"observed_at":"2026-08-10T21:42:12.592020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.595562Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.595562Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:cc2d9954e7b8978a7bd13c978fa07aa1e97eaead837fcda5bb1fcf1e6e8e493f","observation_id":"42a7f07d-0e9c-47e6-9eb2-27e3fb6c1b78","resolution":{"observed_at":"2026-08-10T21:42:12.595562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17205","last_updated":"2024-05-22T05:11:56Z","snapshot_observed_at":"2026-08-13T04:09:28.566996Z","submitted_at":"2024-02-27T04:55:03Z","title":"Measuring Vision-Language STEM Skills of Neural Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17205","snapshot_observed_at":"2026-08-10T21:42:12.598921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.598921Z"},"links":{"cited_paper":"/paper/2402.17205","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:4c59f64cc056bf99ae04d8dc50ce9a4d80d0eb4d4c2d5cb29552b392e64b0311","observation_id":"85e20666-c225-4740-8fe5-149ab2ebc6c8","resolution":{"observed_at":"2026-08-10T21:42:12.598921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07226","last_updated":"2023-03-13T16:00:31Z","snapshot_observed_at":"2026-08-13T12:25:38.424028Z","submitted_at":"2023-03-13T16:00:31Z","title":"Scaling Vision-Language Models with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07226","snapshot_observed_at":"2026-08-10T21:42:12.602415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.602415Z"},"links":{"cited_paper":"/paper/2303.07226","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:26f1b19e5044820df718871880dc3083a6debd0bd1a6902eece23fa3bd1d9478","observation_id":"783102d4-6863-417c-8daf-09a3d388a22d","resolution":{"observed_at":"2026-08-10T21:42:12.602415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.164777Z","title":null,"venue":null,"work_id":"09de38f1-7e4a-47d3-a7b8-4ce6251765a8","year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.606068Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:e83ff2680dd50d2ed8edfb41b2dd20a1ea5ee593246e4c8ab1b0a257ccad4713","observation_id":"8a9f6e9c-2583-42b5-b382-e50da34bf5c9","resolution":{"observed_at":"2026-08-10T21:42:13.168228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.609286Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.609286Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c119752c495bc25fda53963bcb2cdf98d36adb48fe2a88b2bb51fed7a942cdd6","observation_id":"7755448d-70d6-43a7-9964-dc949058f22b","resolution":{"observed_at":"2026-08-10T21:42:12.609286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02791","last_updated":"2025-04-03T02:13:53Z","snapshot_observed_at":"2026-08-13T04:27:01.626889Z","submitted_at":"2024-02-05T07:59:38Z","title":"PanGu-$\\pi$ Pro:Rethinking Optimization and Architecture for Tiny Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02791","snapshot_observed_at":"2026-08-10T21:42:12.612551Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.612551Z"},"links":{"cited_paper":"/paper/2402.02791","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:b119a1edba13eaf15c4b61f710755c389c47da1819847d76d5445f5c02849d55","observation_id":"54600042-a95f-4061-b0ba-8bf77a3f1ccf","resolution":{"observed_at":"2026-08-10T21:42:12.612551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T21:42:12.616503Z","title":"M.; Hauth, A.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.616503Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:16de157ccd944ca6c32764a53e7629b603ee2d5c6623f407c9e02439dd611597","observation_id":"894fbb6d-f8f7-41e5-80bc-d53241a1c6e1","resolution":{"observed_at":"2026-08-10T21:42:12.616503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.148573Z","title":null,"venue":null,"work_id":"fe3508c1-4ced-416e-b3e7-740bcc2dfc43","year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.620355Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c540cfb093e9e9b2017555ebf60ba119d546de87f78e4be97de471cbd1d3be3a","observation_id":"53edb665-371c-4ef7-9f56-ed1a9a3a3097","resolution":{"observed_at":"2026-08-10T21:42:13.152004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-10T21:42:12.623890Z","title":"K.; Singhal, S.; Som, S.; and Wei, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.623890Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:7a23390e5d4a9534c21e0cd6b403359681dfdc4ca0b501ff57b2d73529bb4a49","observation_id":"68af8662-981f-4c6b-84f2-bfef7d9c9d43","resolution":{"observed_at":"2026-08-10T21:42:12.623890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17276","last_updated":"2023-12-27T11:49:24Z","snapshot_observed_at":"2026-08-13T04:53:24.854643Z","submitted_at":"2023-12-27T11:49:24Z","title":"PanGu-$\\pi$: Enhancing Language Model Architectures via Nonlinearity Compensation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17276","snapshot_observed_at":"2026-08-10T21:42:12.627697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.627697Z"},"links":{"cited_paper":"/paper/2312.17276","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:2e7fca676d0079b8ad3403fb021682e20da90909c1fe01fc4edb2923d2dc3363","observation_id":"675b24f2-a236-4e59-a8b9-61864c16132e","resolution":{"observed_at":"2026-08-10T21:42:12.627697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.631162Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.631162Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:d377b3463f9bc3c5c4e382a482c15ad147daea05cfc78c734824d247a75ec4f2","observation_id":"eef4fe56-a567-401d-bc58-8049c12cbdf8","resolution":{"observed_at":"2026-08-10T21:42:12.631162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07498","last_updated":"2021-09-29T17:09:40Z","snapshot_observed_at":"2026-08-11T15:10:28.425814Z","submitted_at":"2021-07-15T17:51:25Z","title":"FewCLUE: A Chinese Few-shot Learning Evaluation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07498","snapshot_observed_at":"2026-08-10T21:42:12.634761Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.634761Z"},"links":{"cited_paper":"/paper/2107.07498","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:1cd3f658f2d8346e2155eca3839771294d315c237d0110c4bb062d7538e91c07","observation_id":"049351a9-5f5d-4fd3-94a3-e7519a1f4bd9","resolution":{"observed_at":"2026-08-10T21:42:12.634761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-08-14T13:59:48.966916Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-08-10T21:42:12.638612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.638612Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:0a3b364024f713a7ab78fe8b85b1de917e50e251ff8ae1d3cd5054143b29a53f","observation_id":"e5e26d06-e49c-4bed-9787-f7b0f29af39f","resolution":{"observed_at":"2026-08-10T21:42:12.638612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-14T15:08:05.705067Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-10T21:42:12.645932Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.645932Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:c7ca6baa9c1df392725e4519a8bb37a65634f85b0147596420b73311d58afa0f","observation_id":"6fed9b6c-9c23-4ad5-b1ee-45303176c4db","resolution":{"observed_at":"2026-08-10T21:42:12.645932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:13.130423Z","title":null,"venue":null,"work_id":"103c8c84-ff78-4a6a-92ba-f896d3e25aeb","year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.649426Z"},"links":{"citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:f2186b2db1dc6d3d03fa1d143fbc5ed9af220c10322a6d0e46b61b8621570855","observation_id":"dd87f1b0-543f-4db9-acde-2b3d6eb22148","resolution":{"observed_at":"2026-08-10T21:42:13.135226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-10T21:42:12.653313Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.653313Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:156403309faa64be0324309cf527cbc78022928f51c000646905f64b27fcdfe7","observation_id":"649883b4-5106-42e3-96fd-ab2226a01f29","resolution":{"observed_at":"2026-08-10T21:42:12.653313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-10T21:42:12.656981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.656981Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:a2c7ce857ac99ab12b93480e729141ddbed20d574ba63ecd6b0bd00a00b140fd","observation_id":"bbe55a0e-8a98-4d18-b655-69014a31488a","resolution":{"observed_at":"2026-08-10T21:42:12.656981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T21:42:12.661051Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.661051Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:8921abdc4560613446ce032cb7db9ba7351c58da1c43dde3c2f91b101409339a","observation_id":"b8e64968-c8ed-4736-8c20-d820a87b9e5a","resolution":{"observed_at":"2026-08-10T21:42:12.661051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-13T04:48:56.604912Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-10T21:42:12.664774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.664774Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:e7b0b249911689b221af52fb4d2b8ea5d3851e276713c499d57529f8067ca2db","observation_id":"b47da43e-68bb-4219-90ff-0a9e8e9856fe","resolution":{"observed_at":"2026-08-10T21:42:12.664774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:57:34.614108Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 10 inbound Pith citation observations for arXiv:2501.04322."}