{"as_of":"2026-08-10T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:740d3ba8f3bd16c0f3d6cbd26661c16d42d6bc3bfdabec0d0476f5eb6fca7ecd","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:25:56.014437Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:47.528488Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T18:51:16.046798Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evev2: Improved baselines for encoder-free vision-language models","venue":null,"work_id":"02a48cd8-382f-4844-b0ef-a671cb8e7486","year":2025},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:6c6669d13b40bb61b6d20a0a23aae2aa5262c0e576350e158762cb5f398c97fa","observation_id":"738bf878-8fe3-40a2-9a84-d4a0079b3f59","resolution":{"observed_at":"2026-05-11T21:22:37.318223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-07T00:23:47.528488Z","title":"Evev2: Improved baselines for encoder-free vision-language models.arXiv preprint arXiv:2502.06788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.528488Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:3824a7defe3bb106ed8dae6d6dac72c4046be832d1e4e019423f9d870285096c","observation_id":"debf2a9a-6d76-491b-8c8b-dd7dab277001","resolution":{"observed_at":"2026-08-07T00:23:47.528488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evev2: Improved baselines for encoder-free vision-language models","venue":null,"work_id":"02a48cd8-382f-4844-b0ef-a671cb8e7486","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:3e6416556ba2326af456e352f974080846775fb91b6cdaa8edf11160b6b0866c","observation_id":"672d1c36-d965-4122-88c2-c3a0e1057c6a","resolution":{"observed_at":"2026-05-12T18:51:16.049795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T21:17:09.482217Z","title":"Evev2: Improved baselines for encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-09T15:31:24.959410Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.482217Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7d9e1bc51fe57dd230eceb5aeaf1ff9599ee57e41cd1ee12cdf66e28cb24a985","observation_id":"d54a2bed-4601-40be-852d-3d6a8fecd470","resolution":{"observed_at":"2026-08-06T21:17:09.482217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T19:15:26.683136Z","title":"Evev2: Improved baselines for encoder-free vision-language models.arXiv preprint arXiv:2502.06788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.683136Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:d7dc7f90c65cc074ecdc86d1b8fdc979579f7f5145856b256b75130a0704daf8","observation_id":"b134bd5a-39fd-43cc-9b02-961aba8666fb","resolution":{"observed_at":"2026-08-06T19:15:26.683136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T13:23:33.793178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20745","last_updated":"2025-07-28T11:52:56Z","snapshot_observed_at":"2026-08-07T22:14:10.868497Z","submitted_at":"2025-07-28T11:52:56Z","title":"Regularizing Subspace Redundancy of Low-Rank Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:23:33.793178Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.20745"},"observation_digest":"sha256:0272479df1199407fd9a52c19264c749b74ad035758b4670a0abd095c1291cc9","observation_id":"fee704c9-80bf-4ae4-aace-ac300f0c8736","resolution":{"observed_at":"2026-08-06T13:23:33.793178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-05T20:04:49.342135Z","title":"Evev2: Improved baselines for encoder-free vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.342135Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b7ec6ebc752c14c50916b5b19536969d65c02c442dedd382d1c15585ca4c849b","observation_id":"6313292f-a74b-4422-952c-043a5e25126a","resolution":{"observed_at":"2026-08-05T20:04:49.342135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-05T11:40:21.474439Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02359","last_updated":"2025-09-02T14:22:43Z","snapshot_observed_at":"2026-08-08T06:17:37.928618Z","submitted_at":"2025-09-02T14:22:43Z","title":"Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:40:21.474439Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2509.02359"},"observation_digest":"sha256:abb4b84111b7ab94bbd826f673964bd09bdfffa2cac0db2d626e4ca0d9ae1800","observation_id":"3c7b937c-c260-4d00-b0f2-9190e4cf32e9","resolution":{"observed_at":"2026-08-05T11:40:21.474439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06788/citation-record","integrity":"/paper/2502.06788/integrity","json":"/paper/2502.06788/citation-record.json","paper":"/paper/2502.06788"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.538636Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sa- hand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar ´en Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.538636Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3bb5437d28a78fbc0c736edccf16762be4857a136f4e99ef5232df0071d6d169","observation_id":"dca388f7-13b1-43f6-bfb8-943b93ac96ec","resolution":{"observed_at":"2026-08-08T14:25:55.538636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.543179Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.543179Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:20cfa992f8400707bcce07a2e1105cdd8952cbe7503172e9a76a4b21d069903c","observation_id":"67ade161-fe1e-4ff1-8266-153d126342bc","resolution":{"observed_at":"2026-08-08T14:25:55.543179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T14:25:55.547154Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.547154Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:64afd40ab7114aa1e7ca2a8aeb9d7f5df3bbc0e403ac5c9ac6cdd61eb13ab2fe","observation_id":"ad2f3fe8-dd74-4490-89b1-f0c28c67c4e4","resolution":{"observed_at":"2026-08-08T14:25:55.547154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T14:25:55.551753Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.551753Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:cd5dbf9925fb77765e9763b2fc69152487aa5e1605729ce6681d7d6fa1f3c096","observation_id":"b58348f8-41d7-4aef-afbd-a9c67865d6bc","resolution":{"observed_at":"2026-08-08T14:25:55.551753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.555696Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.555696Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:1730446c52de287a64c0c2f4061d22123c2683a63d24f5176e6976152681ce0a","observation_id":"ce6090de-bcaf-41a7-b85b-0c90eb67a69b","resolution":{"observed_at":"2026-08-08T14:25:55.555696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.559567Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.559567Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:bbdbd856d417498d2cefddb7a2bf1d242c78f74d0b89ff6da15c557075e2b188","observation_id":"c762701b-d418-48a4-bcfe-4c86aab26ea1","resolution":{"observed_at":"2026-08-08T14:25:55.559567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-08T14:25:55.563893Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.563893Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:879b660248263812e4b37ab81f17687562af89d663e6472c2dad78ccf8a0dd23","observation_id":"221102a1-281e-48c6-bda6-87361a5eb6d7","resolution":{"observed_at":"2026-08-08T14:25:55.563893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-08T14:25:55.568135Z","title":"Deepseek llm: Scaling open-source lan- guage models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.568135Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:c221956f75f372425c6ad0b8e3c48b0c8f4ff5dde19c1d97d2da9a7c03fa7f5c","observation_id":"5432cfb1-ca45-4f38-9fb5-61c215c0d961","resolution":{"observed_at":"2026-08-08T14:25:55.568135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-08T14:25:55.572341Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.572341Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:a99deadd1e111a92600e80181d107ba490ff34c3a469f1f8b0f62bad4293410a","observation_id":"8ecb0bf6-542c-4f7b-a0ad-00c64a286e54","resolution":{"observed_at":"2026-08-08T14:25:55.572341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.577160Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.577160Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2a29d4306b8320a895666cc72134610e2c2f696594c163c3f7d480685b25e0fc","observation_id":"80884fde-78f9-4ef3-86fa-a29d904c4544","resolution":{"observed_at":"2026-08-08T14:25:55.577160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-08T14:25:55.581404Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.581404Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:c48d98837cf9900f461c15a6fa33328b0faf497ffb9bc69d7bd31bdb0944f03a","observation_id":"7eafa05a-2662-4281-8b72-ade0241cb59e","resolution":{"observed_at":"2026-08-08T14:25:55.581404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-08T14:25:55.586228Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.586228Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:735280a9ff00c1ddf9213696e035b1ceeab6b13e1beeeb47e634103f7f823cd2","observation_id":"8e6df3dd-dabc-4144-b251-8dbbfc64d53f","resolution":{"observed_at":"2026-08-08T14:25:55.586228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-08T01:21:54.937517Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-08T14:25:55.590338Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.590338Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:5e0eab92b0e82277f4f6d444fd7ac698dc880426aca87850e98b8384c4e02cf9","observation_id":"d783e8fa-cc1c-4ef8-b4d6-8b90a045d9f8","resolution":{"observed_at":"2026-08-08T14:25:55.590338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-08T14:25:55.594875Z","title":"Internvl: Scaling up vision foundation models and align- ing for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.594875Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:48d3a7e530576becb8a29a15bd23002d21c0d779aac90fcad0d2525c6e1249e7","observation_id":"6c10a6ea-6332-4215-ab54-882ef11255a6","resolution":{"observed_at":"2026-08-08T14:25:55.594875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-08T14:25:55.599372Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.599372Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:9f5e6ddabe3366e7ed6134c1526f4d256d53b683f3e3aa594ace663c91a29a90","observation_id":"7bde31ad-577c-4d48-bd9e-090266c3d76a","resolution":{"observed_at":"2026-08-08T14:25:55.599372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.604025Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.604025Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:aef0d84817b8c31a31ca04591da3247f59da706cc8cec5848f28a7bfa32ef08e","observation_id":"48b8cc72-30ba-4ce2-9fe5-9d10bffefb69","resolution":{"observed_at":"2026-08-08T14:25:55.604025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.608163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.608163Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:17c7af9f6a07a970c08f72a133326688d338733d595d1244e2b40d77911e0c93","observation_id":"629ec753-3b7b-4d9f-9569-a92d02f31f2c","resolution":{"observed_at":"2026-08-08T14:25:55.608163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.612376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.612376Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:b1935b6650c3f86ab816dd7a6590ca0350ea5f5aac87f68fe446295e9b6546ef","observation_id":"88d190b8-39bb-458c-b805-d15a854defa4","resolution":{"observed_at":"2026-08-08T14:25:55.612376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-08T14:25:55.616853Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.616853Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:c0075e915c53c47fb4dda9a1a7a602947a999866a81eae648ece31bb70ff6935","observation_id":"ae6bffc1-ee39-4e33-abcb-314b493cca86","resolution":{"observed_at":"2026-08-08T14:25:55.616853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.626452Z","title":"Unipt: Universal parallel tuning for transfer learning with efficient parameter and memory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.626452Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:9c00b6c5817ee8500f47c369f4965a1579b8ae144490d1e96f570a36d3a29b6a","observation_id":"4b42a40c-3e5f-4474-b53c-e0a398311143","resolution":{"observed_at":"2026-08-08T14:25:55.626452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.631027Z","title":"Sherl: Synthesizing high accuracy and efficient memory for resource-limited transfer learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.631027Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:0772449691feb502a2a123989b530a3212bfd6b17debabda7e49332342babad3","observation_id":"8c141db6-6e05-4743-b29e-5de3f755d9b9","resolution":{"observed_at":"2026-08-08T14:25:55.631027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.635179Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.635179Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f04b081889512b5dfac9094b2539f1b978d9f5eebff1670bea940cc4935eae96","observation_id":"8df1a290-7bc9-4313-b547-3fd70e2a5dcd","resolution":{"observed_at":"2026-08-08T14:25:55.635179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.639618Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.639618Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:acd16d1da5c1453e46b706634487f4c53e5066dc2e6ff9cce5fa237bdd963c0c","observation_id":"8f920d46-2e08-450f-9e60-25503d29d0d0","resolution":{"observed_at":"2026-08-08T14:25:55.639618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.643640Z","title":"EV A: exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.643640Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f4ae1fa70c48aa1f48d40f3a60ba228a809a895f49e6a76c3a3998ee6dd9f282","observation_id":"73857e29-a43c-47da-9f67-1ce4521106e6","resolution":{"observed_at":"2026-08-08T14:25:55.643640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-08T14:25:55.648170Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.648170Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:41dfccdb318c28c74f5e84058710b905ecfe5e809c9dfcde6836df8594880c2b","observation_id":"ffb0a214-e505-4402-b316-4916b8ea9293","resolution":{"observed_at":"2026-08-08T14:25:55.648170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.652587Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.652587Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:345083112f2f0fe5dc6495cd76171df5fb0481cbb5afb4c86e30a30b03e5f693","observation_id":"1d493f05-95dd-42c0-bdb9-5841d61728f6","resolution":{"observed_at":"2026-08-08T14:25:55.652587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-08T14:25:55.656727Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.656727Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:18cee8f649b974588e9a6854d883170b435b4a5f0ea9f4ba1c6a5a4f46e845ec","observation_id":"1a0e6a2d-030f-41ad-bafb-7a18b6d46781","resolution":{"observed_at":"2026-08-08T14:25:55.656727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.661080Z","title":"Making LLaMA SEE and draw with SEED tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.661080Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:e61a99512bd702b52a0cadfca7a9f489eeeecebd8b67e34adf50718d895cd712","observation_id":"95f8c69b-3394-4235-866e-88c90fa637d6","resolution":{"observed_at":"2026-08-08T14:25:55.661080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-08T14:25:55.665218Z","title":"Infinity-mm: Scaling multimodal per- formance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.665218Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:8fc36961d4e5470ba14ed57a9cbe6674221617f591f65c7d4508be6036db2a15","observation_id":"51840bca-4d2a-4d65-ae23-6428312a90f4","resolution":{"observed_at":"2026-08-08T14:25:55.665218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T14:25:55.669886Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.669886Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:ec37ab7f38d0ab3d172c92e1b44478011bd1b94cecb238e32897a6e479ba6a3e","observation_id":"ecb5431c-b222-4c9f-85f8-60a5fe5f06a1","resolution":{"observed_at":"2026-08-08T14:25:55.669886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-10T00:01:53.009712Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-08T14:25:55.674294Z","title":"mplug-docowl2: High-resolution compressing for ocr- free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.674294Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:60d00cd9d54247729f13c58aa0a3912e783a4ffd17c41471231bbdce64463817","observation_id":"4ee0b32f-9466-44de-912c-0d4252ff1857","resolution":{"observed_at":"2026-08-08T14:25:55.674294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.678998Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.678998Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:e10c27896d79cc3a5cedcb67d72a9414fced026e944b396f2f67b7b9f873e6bf","observation_id":"c7b681be-1ef4-4d70-9983-78e3b19a678b","resolution":{"observed_at":"2026-08-08T14:25:55.678998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.683411Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.683411Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:7bff309df74e623c03d51367896f53bdc24f7e32c710a5f61157a16f22769eb0","observation_id":"46e6663a-f404-4645-a07e-9ba0fa342654","resolution":{"observed_at":"2026-08-08T14:25:55.683411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.688325Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.688325Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:cea4df81d8ebb37530a3277bc48ff9bc4b6de55d5e8aa3589f500c28cc63e2ee","observation_id":"05533886-e4eb-4811-bf0a-ed1473626e14","resolution":{"observed_at":"2026-08-08T14:25:55.688325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.692617Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.692617Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2c116f21dccfeec28352f9aa87f87fd0bd2b61e17f701347883c1c333cf3642c","observation_id":"e9e3624d-5fa5-40f2-8600-4f2a71cbff7c","resolution":{"observed_at":"2026-08-08T14:25:55.692617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-08T14:25:55.696864Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.696864Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:d381a7aabc9413a7970f618f57adf300ce73238315d9bee5cf05b6ea7a41ca16","observation_id":"e9c99db6-6e45-492e-93ce-245dc3ed24cb","resolution":{"observed_at":"2026-08-08T14:25:55.696864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00982","last_updated":"2020-02-21T15:15:33Z","snapshot_observed_at":"2026-07-06T07:12:18.190468Z","submitted_at":"2018-11-02T16:58:28Z","title":"The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00982","snapshot_observed_at":"2026-08-08T14:25:55.702211Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.702211Z"},"links":{"cited_paper":"/paper/1811.00982","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:0a7ddc8c596056cf2fec99c5972af5bc80f771c554af14f14a77fa0bdda6444a","observation_id":"37d774e5-ce92-4d38-b783-0bad9ad04198","resolution":{"observed_at":"2026-08-08T14:25:55.702211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-08T02:32:36.154874Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-08T14:25:55.706584Z","title":"Building and better understanding vision- language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.706584Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:de9f263ea234db59fb3b1c015c9898edd4bdce1ded9134ca70782f77dd83db1b","observation_id":"f78ef67f-3e12-4473-8176-d60d129373ad","resolution":{"observed_at":"2026-08-08T14:25:55.706584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-08T14:25:55.711133Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.711133Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:973c61b5c0c40c6d9506e5bccaf04b9b2f4c34401a5df3c3876b5fa7a2672cb6","observation_id":"c345cac1-3c26-484d-8599-56a3de933b85","resolution":{"observed_at":"2026-08-08T14:25:55.711133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T14:25:55.715605Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.715605Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:76c2b4df868047962f0e769feb7f2312d2560a647badd57162050aeb8f17db8f","observation_id":"d68e8ec1-3498-43aa-bcbb-d638cf8dffe7","resolution":{"observed_at":"2026-08-08T14:25:55.715605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-08T14:25:55.720298Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.720298Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:a9abf8c6bd184a0b61f2ba8c16d3c10ed277742e86d00292760b19fecefd7a22","observation_id":"8659e668-aea5-46f6-af9e-87a2a11fa040","resolution":{"observed_at":"2026-08-08T14:25:55.720298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.725842Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.725842Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2a8f256755d4912ea1dd2421cbfcc67a7491b6dd844c09c7950f7f11d2687dfb","observation_id":"434c5d3b-7449-4547-85b9-5bdcaf8734f3","resolution":{"observed_at":"2026-08-08T14:25:55.725842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.730026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.730026Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:49215f83d613c8bd4973e17a3a22e5e30df55bf0fc25299bd37b4acf12c95264","observation_id":"04183272-f961-4012-b78e-14344ab02465","resolution":{"observed_at":"2026-08-08T14:25:55.730026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.734219Z","title":"mc-beit: Multi-choice discretization for image bert pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.734219Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f7a3b1c3ecfd91aca69f4d0ebab02013473754154b16951b17bc7a1b06898499","observation_id":"cfa8f363-afbf-4b8f-b7c7-016e390096fb","resolution":{"observed_at":"2026-08-08T14:25:55.734219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-08T14:25:55.738517Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.738517Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:94c6eabf85111274b9e19b2c0d27965acf323b01c4e7e7aa65181e4d46310f8b","observation_id":"30286c70-f0d9-41bc-bf97-62ed05f26b43","resolution":{"observed_at":"2026-08-08T14:25:55.738517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-08T14:25:55.743104Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.743104Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2f6c81619ed726f741c97daf60e7255902da304ec8d08d3e2bc28c2a6b08448e","observation_id":"e5b52559-e7e7-42ee-8c3b-0be5be797755","resolution":{"observed_at":"2026-08-08T14:25:55.743104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.748054Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.748054Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:0d0d2d0033432755891d95bcbeb9cb4b66d1491268c28ba7cb482e9563d29134","observation_id":"99ea5c4b-be71-47f1-a41a-abb5dfe8ed82","resolution":{"observed_at":"2026-08-08T14:25:55.748054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-08T14:25:55.752574Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.752574Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:996341e7a099e7fdc14463d7975915a07e7852a7fd26cc47174bd6543cfbee68","observation_id":"31365a7f-c765-4263-a232-b30f7ed0088d","resolution":{"observed_at":"2026-08-08T14:25:55.752574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21770","last_updated":"2024-08-12T16:20:37Z","snapshot_observed_at":"2026-08-09T08:07:42.316346Z","submitted_at":"2024-07-31T17:46:51Z","title":"MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21770","snapshot_observed_at":"2026-08-08T14:25:55.756888Z","title":"Moma: Efficient early-fusion pre-training with mixture of modality-aware experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.756888Z"},"links":{"cited_paper":"/paper/2407.21770","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3907979e3dc2c6b5db2ddf436dc6ce8407d633c66d4a627df3b998547690c0e5","observation_id":"9c745885-3cd2-4023-9e08-f5804c1b595c","resolution":{"observed_at":"2026-08-08T14:25:55.756888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-08T14:25:55.761283Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.761283Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3cfb449d364de0e96e543aad1edd5d26cbef0c1e809cb9f8a5d96296b5e2d9bc","observation_id":"c0f36955-c614-419b-981f-7ea9a73f4a56","resolution":{"observed_at":"2026-08-08T14:25:55.761283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.765855Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.765855Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:9130fcb076413a53a5675c08caeab3607676689b60c4057026096534d5144c7d","observation_id":"fd7ef618-850f-410d-8e22-7d8e3e76e45b","resolution":{"observed_at":"2026-08-08T14:25:55.765855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.770240Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.770240Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:4db3160dcefa06d95305ed7afa9ab9f0cea20485dced6971528487ba84b8b99a","observation_id":"f033e7b3-34cb-4d64-a059-1ab62a84e988","resolution":{"observed_at":"2026-08-08T14:25:55.770240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-08T14:25:55.774516Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv: 2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.774516Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:7f9aa18ccca8939430f900ba93ad98308963219357ed6e0a38a82036b3e6990e","observation_id":"c808b132-449d-4dfc-9c58-196374f34cc6","resolution":{"observed_at":"2026-08-08T14:25:55.774516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-08T14:25:55.779074Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.779074Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3691bbc831cd7bc7f38122360d63d2722ce27b27f556fab224301c0d4f17acbf","observation_id":"a26125b8-633d-4986-9a9e-0a49ba8c0aed","resolution":{"observed_at":"2026-08-08T14:25:55.779074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-08T14:25:55.783785Z","title":"Deepseek-vl: Towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.783785Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:c5da7d51efe0d128fcc5bb0312b8308b8205a5a01e91a335e0e47bd7107b58bc","observation_id":"c8044e42-29ea-4c47-8829-d402045b0052","resolution":{"observed_at":"2026-08-08T14:25:55.783785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.345431Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"986aab85-cfae-4e08-9d8a-dc43c6a2b8f7","year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.788669Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:32b5d20dc84de9ffe2fff55b0df1df3dd31a73b2eba45a003c87c7cbe94b6295","observation_id":"57650a85-2453-464f-8f88-97e868b7b9cb","resolution":{"observed_at":"2026-08-08T14:25:57.351165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-09T05:13:18.023230Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-08T14:25:55.793608Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.793608Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:e991ad00099ec37d9c90bb550727b21c4d6a307bc66a6f3d2b6c5faaa569bb4e","observation_id":"6ce369cc-c52d-4505-888e-59dff9b73e0e","resolution":{"observed_at":"2026-08-08T14:25:55.793608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.329668Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"0f7189e2-8a2c-41d1-9464-562b0b67c9b0","year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.798660Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:d3bbc8c6e352f41881a8bd0f6bcdedfb87587bd795122ee2b13298944be8bc80","observation_id":"c5785fe5-8416-4bfb-ae01-70935eb28920","resolution":{"observed_at":"2026-08-08T14:25:57.335376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:25:55.803714Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.803714Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2c237a74be3fc5bb30aa580888584af5f5ed7201197f396396548a3d7c843f39","observation_id":"5e87e700-855e-4fdb-b467-e8950e3bfd15","resolution":{"observed_at":"2026-08-08T14:25:55.803714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-08T14:25:55.809314Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.809314Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:ab4d3dcd9a60e0e2fc16dcb4889d3fc71d155f5070b14bb66f839c1205458eaf","observation_id":"cca3d66c-37d2-482a-8e41-0ba9f8c5a2c1","resolution":{"observed_at":"2026-08-08T14:25:55.809314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.314279Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"feee97af-a2ab-4622-a8e3-03b1283c2fc3","year":2021},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.814565Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:381b64a8cf24f637aab54048262e995f880547d1e29fcd68845196634019d898","observation_id":"f225d90c-9381-4d87-afa2-f12751545a72","resolution":{"observed_at":"2026-08-08T14:25:57.319691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.297863Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"a67a16de-acab-4d0f-8388-ac7c2181b60a","year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.819490Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:1d3db178b0fa4e76fc7dccf64bac4884c3c52ac93c6372b52d63b22b0376cfce","observation_id":"75ff3c6e-5086-40d9-8139-5aa60808a861","resolution":{"observed_at":"2026-08-08T14:25:57.303982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.824630Z","title":"Towards VQA models that can read","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.824630Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:893e480d364050d11d252e62911850a6eb76f8e9e46065ffb4c8c9056ed75081","observation_id":"e63c32b6-ad8c-4af5-996e-cc77c8173dbb","resolution":{"observed_at":"2026-08-08T14:25:55.824630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T14:25:55.829308Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.829308Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:0463815edbbb43bcc14dbff3f84e857c5d54529d39b26793b5a9a884e6b8db35","observation_id":"4c5760b1-99d1-4b68-8f66-7d34184d09b8","resolution":{"observed_at":"2026-08-08T14:25:55.829308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T14:25:55.834228Z","title":"Generative multi- modal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.834228Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:fd2308d687b8ceae9fc17716936b828c8b784d91c51f92e11b764dedaed250bc","observation_id":"93fee7ad-4953-479f-a040-2b380c6b26f9","resolution":{"observed_at":"2026-08-08T14:25:55.834228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-08T14:25:55.839354Z","title":"EV A-CLIP: improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.839354Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:08e6d58e01f8758df815f3f7b0acb6410771ef567724d5695d039cc56f557804","observation_id":"291b4ece-9106-4d66-b709-a4847c6ec119","resolution":{"observed_at":"2026-08-08T14:25:55.839354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-08T14:25:55.844863Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.844863Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:5fb407af149d67e241606c0b51a6219a11e06a16d2667e67c355f91330fc4bdc","observation_id":"896d60e1-29b6-4d45-a5fe-313b2a6f62cd","resolution":{"observed_at":"2026-08-08T14:25:55.844863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-08-09T19:13:53.289650Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-08T14:25:55.850157Z","title":"EV A- CLIP-18B: scaling CLIP to 18 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.850157Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3510ebdfd6efc7bb64eb7fdb80272ac07904df727232698151dd252866d5ce49","observation_id":"20477537-a323-4c31-956e-b3057dc27188","resolution":{"observed_at":"2026-08-08T14:25:55.850157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T14:25:55.855575Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.855575Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:fbdb8b56cbbb3d9b08eb384acdde0616c86363bde13e94bd3b899a5c01874a63","observation_id":"6fae62d9-4f4b-4d6d-b363-2743ff019593","resolution":{"observed_at":"2026-08-08T14:25:55.855575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T14:25:55.861005Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.861005Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:5e69eed8c999e944d0ce77f24d2b1e353a95b7451e1214bffdcc0b06df405f53","observation_id":"5032d9f8-67c8-4a72-b8b8-0bd64789f976","resolution":{"observed_at":"2026-08-08T14:25:55.861005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.866397Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.866397Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:5e29d4bcd15b7e8c9421240eff9d0efee24e90196cff8ab102a972350eb665c0","observation_id":"a34eda86-776c-44fa-868b-a9e1fb2913bd","resolution":{"observed_at":"2026-08-08T14:25:55.866397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.262113Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models, 2024","venue":null,"work_id":"6a791d44-bb26-4414-a4de-8990e218222c","year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.871639Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:b63a8ff9f89c74c047564c8c2a64d8044525a8ee5e39484202b42b76512792d4","observation_id":"fe8f12eb-f70a-43da-986b-e18ff6f57368","resolution":{"observed_at":"2026-08-08T14:25:57.268277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.244675Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"359d8bdc-8328-4255-bc8a-f1abc3607eb5","year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.876978Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:e40157039c5c779f43a7c9591c50528e0024bac46e3213ea8bfc8c2e9f96abbe","observation_id":"9332fce2-4319-4647-8547-2703bc9313cd","resolution":{"observed_at":"2026-08-08T14:25:57.250633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-08T14:25:55.882208Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.882208Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:8595136406ed9c1638612b8b7023d06082656211a94dc3fb44ba73b942898300","observation_id":"ca957625-1e55-4d79-9348-2ac58e780253","resolution":{"observed_at":"2026-08-08T14:25:55.882208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.226997Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"e2686ee1-a5b5-4b11-bcd0-297ace75bb33","year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.886692Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:c18e5a5526c8039d9cea1f8ec619748aa75e18f45eecc8f78e094f37fd006411","observation_id":"d6f37dae-d47b-4967-bf9c-903653c1beda","resolution":{"observed_at":"2026-08-08T14:25:57.233562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T14:25:55.891210Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.891210Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:75b52de5a34a1413aa320f30769b6a88dce16cfa68d0fa245835a35d0ecb74ce","observation_id":"3f85f9b3-f2d7-426a-b4d0-b354b2599d2c","resolution":{"observed_at":"2026-08-08T14:25:55.891210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:25:55.895582Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.895582Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:e021b272b9d53af02efa1d4a6e8401f480e7c7294e26cf91e4055712a1488a34","observation_id":"02f7baf5-9b60-4052-bdd7-c7ededa5d4f7","resolution":{"observed_at":"2026-08-08T14:25:55.895582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.900288Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.900288Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:8d11718f9c0c2a04c4898fdefd98ad02163a38e134aaa8b01084c0b46a3c4414","observation_id":"66893499-3a31-4a5b-a2ee-e32626443428","resolution":{"observed_at":"2026-08-08T14:25:55.900288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.199525Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"75c159eb-c643-43dd-b6b1-00e9c9bdaf1b","year":2017},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.905656Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:febe90c0e1a77f961b36d837f2fd2697bd4c7188b125b5175b3e11ded5378ea7","observation_id":"cc369af7-71b0-4de6-a412-14689454093b","resolution":{"observed_at":"2026-08-08T14:25:57.205036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-08T14:25:55.910395Z","title":"To see is to believe: Prompt- ing GPT-4V for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.910395Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:db61deba05cb13f6228b0d941e287e08d40f5a7fc5f64064ddea893fe3bbd4bf","observation_id":"c6280041-f4b1-4ef6-ae4a-877331f0c2b9","resolution":{"observed_at":"2026-08-08T14:25:55.910395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T14:25:55.915568Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.915568Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:77f8cf077fda95365dbaeed62ca6a144b63edc4187dbd2972208aa5b5d1b82b1","observation_id":"929ff2b0-581b-4122-91c6-67f012e7033a","resolution":{"observed_at":"2026-08-08T14:25:55.915568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-09T06:43:33.951821Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-08T14:25:55.920632Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.920632Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f6067dc2a69099b79faa1e26facd5a63b1f57ba0bc6ba868995c70ff07806cfb","observation_id":"fdbfd165-2d57-4b32-a820-fefd637ea767","resolution":{"observed_at":"2026-08-08T14:25:55.920632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-08T14:25:55.925834Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.925834Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:811675adc7f52cd665861a58776b481597104f325a9143733d3afa1e3792e546","observation_id":"706d3749-3922-494f-bafe-2a68d02fd51d","resolution":{"observed_at":"2026-08-08T14:25:55.925834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.931088Z","title":"Mio: A foundation model on multimodal tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.931088Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:230ba819e9e4ac47d917f6b1d0c558fe668f162fc97cfc4b7a8540e13f7c2755","observation_id":"5380f8f9-1095-4541-8124-9df08d2f2b60","resolution":{"observed_at":"2026-08-08T14:25:55.931088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-08T14:25:55.935935Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.935935Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:53764b63bcc054cd530ab2fcc9af6a122dd4135ad6b0c125570ba016ef4d7703","observation_id":"df984a12-468b-48e4-a4dd-cb0e61fe49b1","resolution":{"observed_at":"2026-08-08T14:25:55.935935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-08T14:25:55.941194Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.941194Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:074042c676300ef25364566a1e6dca3eb032bc37540f201b5d1c18ae84d8df7e","observation_id":"a1f53753-39f3-43f5-8c53-629bcfa2b0ee","resolution":{"observed_at":"2026-08-08T14:25:55.941194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.183009Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":"e85b7b56-6994-479e-ad90-ef66cdf619cf","year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.946792Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:8b96d72dc53f85a9c8d05a77ba49a9a5494d70b329855df6287a5a355629e111","observation_id":"065aea9b-d63f-44d1-9a1c-4ab918e95172","resolution":{"observed_at":"2026-08-08T14:25:57.188693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-08T14:25:55.951584Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.951584Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f4985365db0d274fd455e3e70c27d55d3947ecb26e4915ebef6bcf231e8c25d0","observation_id":"81412cb5-a096-4187-92c2-ff89caf42563","resolution":{"observed_at":"2026-08-08T14:25:55.951584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-08-09T02:10:05.773976Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-08-08T14:25:55.957533Z","title":"Muse- vl: Modeling unified vlm through semantic discrete encod- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.957533Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:6563b53464e34e07ed7cea36591f0d1107bd2dd1ea5bd89690d7d2a20d252884","observation_id":"c23031d0-36ec-4096-8cf9-467741caeef5","resolution":{"observed_at":"2026-08-08T14:25:55.957533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-08T14:25:55.962910Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.962910Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:34be51485ed48c608aa16b09ff186f2070e37be736c6c20c76206dedbacfaa15","observation_id":"c73ca218-7d4b-46d1-83c3-fb6010d0fa22","resolution":{"observed_at":"2026-08-08T14:25:55.962910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:55.968319Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.968319Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:7e85fc175d9e4de299180176bfe0b552dbbd16ddebe1b8aa70c03f7eeac2644c","observation_id":"261b581e-efb5-4d7c-b5d9-71b806c7170c","resolution":{"observed_at":"2026-08-08T14:25:55.968319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T14:25:55.973291Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.973291Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:df4ff43949238d925f451d7644f48b780b994eac3cd6becdb2ebe5cce589944f","observation_id":"52d45ce1-dca6-48c6-ace0-54ccde05b893","resolution":{"observed_at":"2026-08-08T14:25:55.973291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-08T14:25:55.978546Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.978546Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:923ec801b13505e76d67cca56dede2f9c54579e0bee4d9eb5bfdbd1f08720f85","observation_id":"4cee62dc-3aea-45e0-9475-11a758954187","resolution":{"observed_at":"2026-08-08T14:25:55.978546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-08T14:25:55.983562Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.983562Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:455cd73668d438bec52d490a875e0e0cf90649a041d4c282cde3f3c2f8130215","observation_id":"09ba62fb-7ffe-4938-9208-8263578eccf7","resolution":{"observed_at":"2026-08-08T14:25:55.983562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-08T14:25:55.988746Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.988746Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f5710dcce16549c439aabcb65bd0c614712e59c28eafc5ab9e8850ecfb2f8f5a","observation_id":"f231966d-8bb1-44e8-a38e-3b12ef6530d4","resolution":{"observed_at":"2026-08-08T14:25:55.988746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-08T14:25:55.993984Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.993984Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:273b54e7bbf80292c4073f4b57adfb46a96fb5925421b71d05c6c843c96ff801","observation_id":"33569c35-748e-4081-9cc9-a6372427a5fe","resolution":{"observed_at":"2026-08-08T14:25:55.993984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-08T14:25:55.999125Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.999125Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:025b0d87ef17b54cdba9d7c34cf4b87e5e34a572050bc7d3c5a8dd7a09e6cc44","observation_id":"69b9462a-35a9-4365-96b6-38dbc6de95b8","resolution":{"observed_at":"2026-08-08T14:25:55.999125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:25:57.166177Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"669daca9-ef65-4da8-8291-b20b35254dd4","year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:56.004175Z"},"links":{"citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3561c81e47ac33618465f7fabd7a3ebc85b1258df3111b2c6b398cb30d3f2435","observation_id":"44cdbe71-d721-4ea0-a560-daa005694dc8","resolution":{"observed_at":"2026-08-08T14:25:57.171985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-08T14:25:56.009237Z","title":"Anygpt: Unified multimodal LLM with discrete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:56.009237Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:f07413816711bacba61f057c16a8f78d9ffad44f14829d9a0e80eed8c767a5cc","observation_id":"4c7259e3-331b-4aaf-866c-d932f3a74305","resolution":{"observed_at":"2026-08-08T14:25:56.009237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-08T14:25:56.014437Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:56.014437Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:141fc03d1f5e86fe150ce3a09879899828d443ea85a16f8c78ca649638fef264","observation_id":"6dde0cbd-6c00-4a84-a005-0ae1a1f197c0","resolution":{"observed_at":"2026-08-08T14:25:56.014437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 8 inbound Pith citation observations for arXiv:2502.06788."}