{"as_of":"2026-08-17T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b77a6401209dd8ffe36ae18278442d2ef938efc3c067851015bb48d3ff1ad5e2","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:49:28.151834Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08971/citation-record","integrity":"/paper/2505.08971/integrity","json":"/paper/2505.08971/citation-record.json","paper":"/paper/2505.08971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-15T21:49:27.672537Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.672537Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f6d3f39b1c99901fc67b955e4e209a569f5b7b48178c2ed8229cda3440124dbe","observation_id":"b4a69d45-0675-4a6f-9889-01abd5f98526","resolution":{"observed_at":"2026-08-15T21:49:27.672537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T21:49:27.678003Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.678003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c054357ae74e26922b6a65ad23643aa65bb9088107bf71cd45fe0a45c71b6537","observation_id":"eac79578-b33d-4d61-8055-54d5347c4c7a","resolution":{"observed_at":"2026-08-15T21:49:27.678003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.681895Z","title":"MINT-1T: scaling open-source multimodal data by 10x: A multimodal dataset with one trillion tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.681895Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cb1dba1ab866473bb196a11f726ccc94cb307dc5947da027d8a505edcc04cd30","observation_id":"2e4b0177-ebec-4c49-bb28-d1620663d0b2","resolution":{"observed_at":"2026-08-15T21:49:27.681895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T21:49:27.685443Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.685443Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e9fc2d2b46c1ac8abb14d21cd39d1c091190cc8e4a3cb59de6900a3a71e7b4d2","observation_id":"8b7b35db-ab7d-4346-bb4a-ec2459e40c71","resolution":{"observed_at":"2026-08-15T21:49:27.685443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.689864Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.689864Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:213453a0538f54ff690e2fc49b2a8fbc00035a862f37a9acbfb98bb4f0c3a98c","observation_id":"bf650b6e-bd5b-42eb-8b00-a0ef908fd3d7","resolution":{"observed_at":"2026-08-15T21:49:27.689864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.694115Z","title":"Lundberg, Harsha Nori, Hamid Palangi, Marco T´ulio Ribeiro, and Yi Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.694115Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f99bd6771d4d1fbe9cde70a01fec2c359b4338d5e119b2db1976d67a18476c26","observation_id":"a1748332-e4c4-4340-ab26-ebe6c57d6913","resolution":{"observed_at":"2026-08-15T21:49:27.694115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.531952Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"23e94cf5-5243-4caf-9f62-503b6a80a4cc","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.702072Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:3f70d857984dbfc0001a0fe5320ee357c00df91070239e9982918470b830c581","observation_id":"193d4a2f-c0a6-4676-bdd2-cc379ab3f6dc","resolution":{"observed_at":"2026-08-15T21:49:28.536110Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T21:49:27.706161Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.706161Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a834ca717d0c3e31333724902eee7af2e8b54f34c03bd33d813480cf1991c843","observation_id":"e5337ba4-b7db-4866-a6ed-8045cbbe4d53","resolution":{"observed_at":"2026-08-15T21:49:27.706161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.710172Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.710172Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:67e4d2ef7046a1294a15b57e7f0f5f44bfedbf46730e989f20c46e298b6143b8","observation_id":"7d6176b4-2d18-4521-bfd1-43c0e6ddca68","resolution":{"observed_at":"2026-08-15T21:49:27.710172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05243","last_updated":"2024-12-06T18:22:47Z","snapshot_observed_at":"2026-08-11T20:47:10.764744Z","submitted_at":"2024-12-06T18:22:47Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05243","snapshot_observed_at":"2026-08-15T21:49:27.714083Z","title":"Compcap: Improving multimodal large language models with composite captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.714083Z"},"links":{"cited_paper":"/paper/2412.05243","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:97e96cf4f723df339ee1e7fc93737df385a0cb3aa058551f92ca3cf211598f67","observation_id":"b900c1c4-cf50-4c71-a589-a6197200a49f","resolution":{"observed_at":"2026-08-15T21:49:27.714083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10081","last_updated":"2024-03-19T17:51:45Z","snapshot_observed_at":"2026-08-16T14:42:35.827825Z","submitted_at":"2023-11-16T18:37:29Z","title":"DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10081","snapshot_observed_at":"2026-08-15T21:49:27.722824Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural language feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.722824Z"},"links":{"cited_paper":"/paper/2311.10081","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b97487d48c8d2e4c8c0259699727bfd07691effc3dba913ce54c7732f6dcf32d","observation_id":"f3f217c6-9abe-4c43-ab6a-a8756bade8e0","resolution":{"observed_at":"2026-08-15T21:49:27.722824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13258","last_updated":"2023-11-22T09:23:34Z","snapshot_observed_at":"2026-08-16T14:41:14.213731Z","submitted_at":"2023-11-22T09:23:34Z","title":"ViStruct: Visual Structural Knowledge Extraction via Curriculum Guided Code-Vision Representation","version":1},"cited_work":{"arxiv_id":"2311.13258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13258","snapshot_observed_at":"2026-08-15T21:49:29.094905Z","title":"ViStruct: Visual Structural Knowledge Extraction via Curriculum Guided Code-Vision Representation","venue":"cs.CV","work_id":"a2ed5b6b-51e1-4953-859f-61c514867517","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.726826Z"},"links":{"cited_paper":"/paper/2311.13258","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:5582bcce0817a550fafc76342a467d7ce69de0528c75894247746519b0db7153","observation_id":"ef02f1db-390f-4a24-b7e8-23c29d79ab26","resolution":{"observed_at":"2026-08-15T21:49:29.099720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08527","last_updated":"2025-04-07T21:47:09Z","snapshot_observed_at":"2026-08-16T13:10:27.890768Z","submitted_at":"2024-10-11T04:57:48Z","title":"Scaling Laws for Predicting Downstream Performance in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08527","snapshot_observed_at":"2026-08-15T21:49:27.730622Z","title":"Scaling laws for predicting downstream performance in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.730622Z"},"links":{"cited_paper":"/paper/2410.08527","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:587a45cd93ab7dbd6e22b28798f0089dbb607185873e8bb952e93b81e7bbfad7","observation_id":"80f5c340-a661-4d8b-9aea-0324e68270d6","resolution":{"observed_at":"2026-08-15T21:49:27.730622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-16T13:35:58.335260Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-15T21:49:27.734866Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.734866Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e59ee6f7c6d8f9b9605eaecf645f0524f62590e6911c11bb4b7e502961e5c7c3","observation_id":"f7a0b0cc-42e7-4957-8077-93ec3a6cb291","resolution":{"observed_at":"2026-08-15T21:49:27.734866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.739146Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.739146Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:36e444209165e732a3f2a2fb8e7236298c6fb18ade82e686436b7ba53d7042f4","observation_id":"79b26b88-b6ec-4573-8418-6c9a459c59cf","resolution":{"observed_at":"2026-08-15T21:49:27.739146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08687","last_updated":"2025-03-25T22:17:42Z","snapshot_observed_at":"2026-08-16T13:00:15.156174Z","submitted_at":"2024-12-11T18:59:46Z","title":"VisionArena: 230K Real World User-VLM Conversations with Preference Labels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08687","snapshot_observed_at":"2026-08-15T21:49:27.743070Z","title":"Gonzalez, and Wei-Lin Chiang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.743070Z"},"links":{"cited_paper":"/paper/2412.08687","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ca0d8ae7100e49b9785fd7e4d263e11f77e4033915a8fd805290c51b61e99894","observation_id":"5f997c8d-10f6-4d55-aa56-1ef07d717643","resolution":{"observed_at":"2026-08-15T21:49:27.743070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.747119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.747119Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:723ccaeb7f8a7fb971ff4b43c1bd38bdd8b04f7126bf00ba73cfafd0a804a4ad","observation_id":"365ae205-0775-4f22-812c-fb6b119112ac","resolution":{"observed_at":"2026-08-15T21:49:27.747119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-16T13:17:44.282942Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-15T21:49:27.751226Z","title":"NVLM: open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.751226Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:dbb91406ce11efaa785eb9c2336803669c1a6795ebf42c792357831d832e4778","observation_id":"eb3e2227-14db-4f52-a364-5876d877d964","resolution":{"observed_at":"2026-08-15T21:49:27.751226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.755310Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.755310Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c5eb2e50489f81abd56d107d5fc392af426c91bcbaafa843605d2d40f03c2c1c","observation_id":"a44695a5-20f7-4c90-9b42-69e27ac5eb05","resolution":{"observed_at":"2026-08-15T21:49:27.755310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.759085Z","title":"A survey of vision-language pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.759085Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:decc609c5d318d1e77fe3d6c89ccb8b4de22036b1a9343f38ae2219b6292a98c","observation_id":"82f4f70d-6151-44d4-a90c-b8a976f052a3","resolution":{"observed_at":"2026-08-15T21:49:27.759085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-16T13:33:47.086873Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-15T21:49:27.762903Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.762903Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d247092671734c1c06521b575facefd4a2c901f9f768b4ed2d3f2ee29e657384","observation_id":"2638719a-6663-4c36-8752-37b15a7b659b","resolution":{"observed_at":"2026-08-15T21:49:27.762903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:49:27.767272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.767272Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e70c2bd2838e4a6fdc70b5a09eba3db48b23ca72ed8c25c77f8e098b8606543a","observation_id":"318baf8d-a093-4204-af64-0384b002044f","resolution":{"observed_at":"2026-08-15T21:49:27.767272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-16T13:32:38.056236Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-15T21:49:27.771127Z","title":"On pre-training of multimodal language models customized for chart understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.771127Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ed311e209c6744386e62e1fa2a520f0ca06a860c4df5e7381474505199c9f042","observation_id":"17d48c46-1b18-46bd-8c29-9480716cab80","resolution":{"observed_at":"2026-08-15T21:49:27.771127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.779889Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.779889Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8290f07461bc9837aabf9118eef2b5027da292ad140a52e13d9dd7bb5f7d7aa8","observation_id":"2b3c34e9-828b-4093-9126-33a9a2bd0920","resolution":{"observed_at":"2026-08-15T21:49:27.779889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-16T13:32:38.056236Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-15T21:49:27.775568Z","title":"URL https://doi.org/10.48550/arXiv.2407","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.775568Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c1223140322e516515f282cfd1952522e99b0a095fe69d415d50387316814bfc","observation_id":"ce61c136-8d4b-4514-8c5e-204acd8d0cc5","resolution":{"observed_at":"2026-08-15T21:49:27.775568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.787389Z","title":"Making llama SEE and draw with SEED tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.787389Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6c70e1c61c850d6858164271547c57e2b96d84d0e1ad9dfe9cc09d4e19cdf843","observation_id":"6d789315-dd49-4844-a28b-1c0980a06322","resolution":{"observed_at":"2026-08-15T21:49:27.787389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-15T21:49:27.783967Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.783967Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ccd902da4d1166135fd90d49a25e2b9d149636c46bc371434ef03d7a2d8b1bc5","observation_id":"261dcc71-7fd3-4ff6-a3db-4693e805c0ce","resolution":{"observed_at":"2026-08-15T21:49:27.783967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14907","last_updated":"2025-07-29T21:19:06Z","snapshot_observed_at":"2026-08-16T12:57:09.138408Z","submitted_at":"2025-02-19T00:14:29Z","title":"GneissWeb: Preparing High Quality Data for LLMs at Scale","version":2},"cited_work":{"arxiv_id":"2502.14907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14907","snapshot_observed_at":"2026-08-15T21:49:29.040411Z","title":"GneissWeb: Preparing High Quality Data for LLMs at Scale","venue":"cs.CL","work_id":"cddf30a7-395a-45d1-a272-0e464491eb9d","year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.799078Z"},"links":{"cited_paper":"/paper/2502.14907","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f6600e0cc4608a52f9efaffcbf80d049636d7f5c7938ceed108384e960284c74","observation_id":"3e8ba83b-2c37-4ea6-813b-205a423b23d6","resolution":{"observed_at":"2026-08-15T21:49:29.045263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.791070Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.791070Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:6f2fbdad77ad7b1fa410a1aae20dd12e45b5cf1ebc431d2a1649ae7a41df99d9","observation_id":"2c1f37b1-9fae-4d97-b5b4-a15a1b0d5d06","resolution":{"observed_at":"2026-08-15T21:49:27.791070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.794662Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.794662Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:fdbdccebd86fcb5017a8d72647528248e076f032b00ae47a9a19c868eaa3960c","observation_id":"90741552-0327-4828-a6bd-6b6511beaa7a","resolution":{"observed_at":"2026-08-15T21:49:27.794662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12568","last_updated":"2024-09-19T08:41:21Z","snapshot_observed_at":"2026-08-16T13:17:15.224129Z","submitted_at":"2024-09-19T08:41:21Z","title":"InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12568","snapshot_observed_at":"2026-08-15T21:49:27.810010Z","title":"Infimm-webmath-40b: Advancing multi- modal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.810010Z"},"links":{"cited_paper":"/paper/2409.12568","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:06833c0aab1d09511bb30fde768d8bd98a1f810e93a2391ecf5c02ffb0787969","observation_id":"02a9fbaa-accb-46e2-9ae0-697d8c48db7f","resolution":{"observed_at":"2026-08-15T21:49:27.810010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-08-16T15:34:45.261111Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-15T21:49:27.802928Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.802928Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4b53a1a8c593d0dfdd059f8fb04f2e46944aa6167bcdfb442e29541f7ef3e8fe","observation_id":"f7140819-8ced-4d7d-b98a-4f199578fae2","resolution":{"observed_at":"2026-08-15T21:49:27.802928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-15T21:49:27.806428Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.806428Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d8f64d200a64aedbb7033b3e76b0c541dbc6acd738a281ec875edf31c40c017c","observation_id":"e98f92c9-47e8-4a08-a328-0c1cdccc6de9","resolution":{"observed_at":"2026-08-15T21:49:27.806428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T21:49:27.822792Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.822792Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4161d956ecda79f9358ddd15e467b637e563901a81d0537a9c544e60bd0f3f53","observation_id":"fd34ff79-fe5c-48bb-81c4-b443b111b954","resolution":{"observed_at":"2026-08-15T21:49:27.822792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09937","last_updated":"2024-08-19T13:55:42Z","snapshot_observed_at":"2026-08-16T14:00:45.702335Z","submitted_at":"2024-04-15T17:03:41Z","title":"Compression Represents Intelligence Linearly","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09937","snapshot_observed_at":"2026-08-15T21:49:27.814220Z","title":"Compression represents intelligence linearly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.814220Z"},"links":{"cited_paper":"/paper/2404.09937","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f54c6b391554ce2d80fa4151a7e69b1e415ffe36f7babec8f61ec26c75df9b2c","observation_id":"b1cc2334-1a52-4202-9562-d6522531ad34","resolution":{"observed_at":"2026-08-15T21:49:27.814220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T21:49:27.818250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.818250Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2d605f75b337bdda642e9b3483156a7979c6f4c31163593e571053affc9a1a65","observation_id":"5f83a591-95c1-4821-8c14-0b91a272b4e2","resolution":{"observed_at":"2026-08-15T21:49:27.818250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10462","last_updated":"2025-04-14T17:50:20Z","snapshot_observed_at":"2026-08-16T12:41:13.769930Z","submitted_at":"2025-04-14T17:50:20Z","title":"The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10462","snapshot_observed_at":"2026-08-15T21:49:27.833950Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.833950Z"},"links":{"cited_paper":"/paper/2504.10462","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a5b0949087f75e5f0a9e79beb0f50caed11f64d83fa1d44fb4dead3d2fc732da","observation_id":"a3172c1e-ea2e-428d-96a7-4e2d469dff55","resolution":{"observed_at":"2026-08-15T21:49:27.833950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.826874Z","title":"Grounding language models to images for multimodal inputs and outputs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.826874Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cc3d99ff8bb1fd277a03f966c79ae0dd492be619dd75cf483d869af70c782b40","observation_id":"15b72efd-41e5-4a00-861f-fecff345027b","resolution":{"observed_at":"2026-08-15T21:49:27.826874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-08-16T21:04:16.474876Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-15T21:49:27.830463Z","title":"Rl with kl penalties is better viewed as bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.830463Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f1fe22564be9c9901838e567d238a6e020f48374382b91745d6a9abee0dba2b9","observation_id":"876999fe-af79-4977-ba31-ae9939d891db","resolution":{"observed_at":"2026-08-15T21:49:27.830463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.844873Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.844873Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c06acfe3e49b3fa348054d30c2aa40862c53c7a29dd0655bb233d52691f0ca2d","observation_id":"eb459e6f-d094-4a22-b529-c4d5196e416d","resolution":{"observed_at":"2026-08-15T21:49:27.844873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-15T21:49:27.838051Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.838051Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:36077586c7669b12073652024be1046627206ec28c6cf34e7c6bbb2d44a1e23d","observation_id":"6f610eba-bf88-417c-9484-6b7154780b3f","resolution":{"observed_at":"2026-08-15T21:49:27.838051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.841739Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.841739Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:eca76f924338e5764a2ae86add2ba06e9b3495b8c532f99f82f5a2afeffcb38a","observation_id":"c0160033-8a5e-4766-9c5b-caf5b1c93210","resolution":{"observed_at":"2026-08-15T21:49:27.841739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-16T14:34:02.863082Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-15T21:49:27.856076Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.856076Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:380d1849942a40bd71449ae0fb975b7b5ff1125b7cc071974cc968e206990ccb","observation_id":"7480b147-b897-4d8e-9dd4-b9379c5240ac","resolution":{"observed_at":"2026-08-15T21:49:27.856076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.848093Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.848093Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f8c45817da23a2e1c1d83e69e6293643584d12afa87e987d48b3cd3e34d7bbbb","observation_id":"4d435741-251e-484a-a5fa-5145de9af93e","resolution":{"observed_at":"2026-08-15T21:49:27.848093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.851400Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.851400Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2a8d8b5d2708ccadc12b7fba4eda3c7d8f9707ce2961d5732d03f9c51285284e","observation_id":"83152920-85f9-464a-a8b2-9e820abe7f2d","resolution":{"observed_at":"2026-08-15T21:49:27.851400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08418","last_updated":"2024-07-12T08:54:51Z","snapshot_observed_at":"2026-08-16T13:43:39.205872Z","submitted_at":"2024-06-12T17:01:04Z","title":"OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08418","snapshot_observed_at":"2026-08-15T21:49:27.867920Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.867920Z"},"links":{"cited_paper":"/paper/2406.08418","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:dbced8c37b800d50e7c127d61a215eef5654ca350203ca3714f178c81a40b48d","observation_id":"e389e1cd-a794-40d7-bfc2-84c10a3bb9d7","resolution":{"observed_at":"2026-08-15T21:49:27.867920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.860976Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.860976Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cd39efcf2cc304b5e0e87f42cb323399bf93490047d99efcd47a99c75c692ff7","observation_id":"64b974cf-03f0-4957-9ade-a54420a8ddf9","resolution":{"observed_at":"2026-08-15T21:49:27.860976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:27.864520Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.864520Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:3e454984729d9d47c1a70e11138ba6d960b79e96109724b7417baddc04bad4cc","observation_id":"0e1943bf-0a4e-4196-943c-f2405ecb5dc8","resolution":{"observed_at":"2026-08-15T21:49:27.864520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-17T13:46:06.833799Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-15T21:49:27.879585Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pre- training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.879585Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f0cdea91f9ab3847a1564971d35d7a99f7b3c9545c37dc82b5bf6c3408437216","observation_id":"030a7c39-0ea4-48c8-985e-e6137171ad2d","resolution":{"observed_at":"2026-08-15T21:49:27.879585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-15T21:49:27.871672Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.871672Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:117e1d7a13119b9679c4c8b52175a569d0c9dcb368e1faab579e8ba55d36a86a","observation_id":"5f3ca946-0d59-4336-ab7c-e5c123507aef","resolution":{"observed_at":"2026-08-15T21:49:27.871672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-15T21:49:27.875302Z","title":"´Alvarez, Bryan Catanzaro, Jan Kautz, Andrew Tao, Guilin Liu, and Zhiding Yu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.875302Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:aa5f832ae216f39a48bf38cf85cb04d093cd163affd9d9ca877614d53c85363b","observation_id":"a24ff640-5790-44ae-81e3-8638138857b3","resolution":{"observed_at":"2026-08-15T21:49:27.875302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-15T21:49:27.994447Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.994447Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:430f228ac8eaa8bbf2447f1e55217a1a037d7917cc8b85d4e5e3655693b151b6","observation_id":"d0b3e2b7-8bed-41e6-810d-ead96c0b64d5","resolution":{"observed_at":"2026-08-15T21:49:27.994447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13145","last_updated":"2025-03-18T07:02:33Z","snapshot_observed_at":"2026-08-16T12:57:12.589337Z","submitted_at":"2025-02-18T18:59:57Z","title":"Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13145","snapshot_observed_at":"2026-08-15T21:49:27.884393Z","title":"Multimodal mamba: Decoder-only multimodal state space model via quadratic to linear distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.884393Z"},"links":{"cited_paper":"/paper/2502.13145","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ea6fb5618cbbbc3f6ef065ce73ee23a6dd832ac0959455079b1d14103941312c","observation_id":"55e44184-c986-4471-9ab1-d201a7d5b174","resolution":{"observed_at":"2026-08-15T21:49:27.884393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.369257Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"99c53cbb-c0f7-48d4-af56-b542f9d7ed68","year":2014},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.888232Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9ab3959917e4f767d8bc8b622e87b34671902878f9e2949a6416db94d8d8effd","observation_id":"64af87a0-4391-48d9-a7b1-402833b212ec","resolution":{"observed_at":"2026-08-15T21:49:29.373240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.356250Z","title":"Visual instruction tuning","venue":null,"work_id":"c4e66ba3-e72f-43bf-9243-71f3ba398ba4","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.007067Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:96ec9822849a7a2d0a31ebdcbb6e80f19dd99edc4e962a8ed09ae7b790d4add5","observation_id":"0f72c81f-683a-4b5a-8cb7-c7b016a21ec2","resolution":{"observed_at":"2026-08-15T21:49:29.360488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09731","last_updated":"2024-02-16T17:30:41Z","snapshot_observed_at":"2026-08-17T16:42:19.270955Z","submitted_at":"2023-11-16T10:02:40Z","title":"Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09731","snapshot_observed_at":"2026-08-15T21:49:27.999473Z","title":"Examining llms’ uncertainty expression towards questions outside parametric knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.999473Z"},"links":{"cited_paper":"/paper/2311.09731","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:11f00f9b1aaa93804d215645bfe15faae19c2b609095f8af483591dd4c79dfc8","observation_id":"c8d007ba-729f-4e2b-ba97-02809fd98630","resolution":{"observed_at":"2026-08-15T21:49:27.999473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-15T21:49:28.003360Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.003360Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2c7827be84e3b5b8e5c1334160cb8e290a6f43d5b1de82f626c30f5bfafbc757","observation_id":"74826612-12bf-4a03-a56c-c979fb637aa1","resolution":{"observed_at":"2026-08-15T21:49:28.003360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.018040Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.018040Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:637d52b74a39c38ff31e3dc90f5ace7dbedd90d6a3b622eccda5f094e07de228","observation_id":"25e0a611-7da3-4a9a-a5f3-78cf6b062332","resolution":{"observed_at":"2026-08-15T21:49:28.018040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-17T00:50:40.901836Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17451","snapshot_observed_at":"2026-08-15T21:49:28.010620Z","title":"Diving into self- evolving training for multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.010620Z"},"links":{"cited_paper":"/paper/2412.17451","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:79b31e1a5317d70b95668046c8975a72a1a8bdd4f52894a6322beecb0c404a74","observation_id":"1c4e6354-915d-4aab-ade1-b9e1fd6fde6e","resolution":{"observed_at":"2026-08-15T21:49:28.010620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15838","last_updated":"2024-08-07T09:34:25Z","snapshot_observed_at":"2026-08-16T13:32:03.059526Z","submitted_at":"2024-07-22T17:55:22Z","title":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15838","snapshot_observed_at":"2026-08-15T21:49:28.014362Z","title":"Mminstruct: A high-quality multi- modal instruction tuning dataset with extensive diversity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.014362Z"},"links":{"cited_paper":"/paper/2407.15838","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:2cb90daddf9431e726460d6dfb7db97bb126986800a01bff38b176f2fe6eef0c","observation_id":"abcf93ad-1c9a-4057-a401-855473f41316","resolution":{"observed_at":"2026-08-15T21:49:28.014362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15232","last_updated":"2025-03-08T05:29:51Z","snapshot_observed_at":"2026-08-16T13:49:54.288029Z","submitted_at":"2024-05-24T05:46:04Z","title":"DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15232","snapshot_observed_at":"2026-08-15T21:49:28.035412Z","title":"DEEM: diffusion models serve as the eyes of large language models for image perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.035412Z"},"links":{"cited_paper":"/paper/2405.15232","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c5b8b1b0c1fc6b6fe7e4a0d42837a03af719a6ae5d03e77fe3fd7950c409fa6f","observation_id":"ebb61c47-cd18-4434-9020-7256098dcdf9","resolution":{"observed_at":"2026-08-15T21:49:28.035412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T21:49:28.022589Z","title":"Deepseek-vl: Towards real-world vision-language understanding.CoRR, abs/2403.05525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.022589Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:18bfc90f34b820a89ba47a9b8f1cda8267c510891a2803428635f2eed260f46d","observation_id":"fd2b56e1-36e0-4c13-ba33-2fda71e1fd25","resolution":{"observed_at":"2026-08-15T21:49:28.022589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T21:49:28.027700Z","title":"URL https://doi.org/10.48550/arXiv.2403","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.027700Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f978afffe1ed839f73c2da3f4cbc9dd7c9a4cb27196e50d39072d1cbcd35c5f0","observation_id":"13a1a594-15ed-44fe-968a-0f57024e18d4","resolution":{"observed_at":"2026-08-15T21:49:28.027700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.335819Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"4daa61fe-fdfc-4530-b8d4-3716498ce65c","year":2019},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.031470Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:3c75bb8993817b757639370823f37d9bf5275216148b0d4e009dd833f7939ffa","observation_id":"96804bae-efba-4945-9a92-aa6c61c3e9ae","resolution":{"observed_at":"2026-08-15T21:49:29.339876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.051509Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.051509Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4b4b44530f0fe6ce802a16bed57999ce527c222a2c5610af718c14e8fd8257ba","observation_id":"85f6e33c-f575-48ce-8f74-8ac8a5a68c97","resolution":{"observed_at":"2026-08-15T21:49:28.051509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05840","last_updated":"2024-12-31T14:46:47Z","snapshot_observed_at":"2026-08-16T13:20:01.876665Z","submitted_at":"2024-09-09T17:44:00Z","title":"MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05840","snapshot_observed_at":"2026-08-15T21:49:28.039274Z","title":"Mmevol: Empowering multimodal large language models with evol-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.039274Z"},"links":{"cited_paper":"/paper/2409.05840","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:32939f5040b3afc79831298e7feb8c5be0ae524ea3b8855276b09c924bec9d7e","observation_id":"d6cbddcc-b0f9-4c4f-87ed-ae55c6cbc287","resolution":{"observed_at":"2026-08-15T21:49:28.039274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.043623Z","title":"Openomni: Large language models pivot zero-shot omnimodal alignment across language with real-time self-aware emotional speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.043623Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:a2ac1688c944400fabd5d25cc15a2000eec8e11ad15a5f54d575d04618214374","observation_id":"c1d25b96-0c5f-40ef-85d1-08513a34091f","resolution":{"observed_at":"2026-08-15T21:49:28.043623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.047320Z","title":"Policy opti- mization via importance sampling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.047320Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:4c8833fc54feca62b84743fc08e5dcdf8772f3ce186fff33db85e04d56f7a2bb","observation_id":"bb22e9f9-d6f7-4ba8-aab5-1e175efc7fce","resolution":{"observed_at":"2026-08-15T21:49:28.047320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.066102Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.066102Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:883433961bc43775124269fa2ab9d83c2e593376649f0401a351d15447b3cb38","observation_id":"1dbcd1a2-a988-47a4-a2d8-dd151e8fc9d5","resolution":{"observed_at":"2026-08-15T21:49:28.066102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.055287Z","title":"Shaker, Salman H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.055287Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:48f247f806f8360aa3bef1e8fbcd738913abfb94223d82c3985133a8b1e3c204","observation_id":"b9abe44e-0b76-4db6-ac12-ddaf0d0f5925","resolution":{"observed_at":"2026-08-15T21:49:28.055287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.058792Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.058792Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:cb0aede973b3d9f113c7428809164da5e41505001c2985f4584cf58d56681e8b","observation_id":"3879d285-9344-4d6b-bf72-5688cc28d5f0","resolution":{"observed_at":"2026-08-15T21:49:28.058792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-15T21:49:28.062362Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.062362Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:756beec5b3874b783fd89cdbbb2890997f0b06b0b1b5fd84db4e74212a2b5e96","observation_id":"d6bea31c-8c9a-4b51-8623-3ed4649d3763","resolution":{"observed_at":"2026-08-15T21:49:28.062362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.285937Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"f1d8715e-3bc3-46ba-b08f-612dba6059ec","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.080798Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b60b3f4d91d8fc652f41ea32a9ea66459bccd49fabe544fadfba5d154ae1b583","observation_id":"cb89ef5c-69ad-403c-aafe-b27ca3640b4e","resolution":{"observed_at":"2026-08-15T21:49:29.290113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.298596Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"f0a6eeb4-b959-49c6-9bf8-e18a8bbb7ecf","year":2018},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.069756Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:3ddc1c0c88b8e3e2f22fd3ac1bfc38c94442db557fdc8b37c324b85282354213","observation_id":"5b5cbdee-8ca9-4930-91d5-bebdfe1845d3","resolution":{"observed_at":"2026-08-15T21:49:29.303589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-15T21:49:28.073076Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.073076Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:21e63a983f9c0335347ba5d1c44ad6247ff74e99521afe399cc8f177835953c2","observation_id":"360d5162-a319-46d7-8474-878065e5879a","resolution":{"observed_at":"2026-08-15T21:49:28.073076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-15T21:49:28.077016Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.077016Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:aefc179fc21a8073bb89e0710afb53423b328be95c918e9c5dddece8f38163f6","observation_id":"3da53c17-8322-42eb-b5d4-d3185b89ee71","resolution":{"observed_at":"2026-08-15T21:49:28.077016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.272841Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"7ebd7740-4567-49f8-b9b5-cfa3c06633e6","year":2022},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.095926Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:e79bf72e2683256b1a364243d6bb117280a662f82cf01c29348622139a336460","observation_id":"8ff4b12a-1022-4dd7-a36f-6792416b7a70","resolution":{"observed_at":"2026-08-15T21:49:29.277670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-15T21:49:28.084067Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.084067Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9d19baa4aa23bc26d01d999676f51f856087e6ec1246bab0dae41636f208da01","observation_id":"2df2a628-0da3-4ae6-bef0-8615714bda71","resolution":{"observed_at":"2026-08-15T21:49:28.084067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"cited_work":{"arxiv_id":"2412.16158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16158","snapshot_observed_at":"2026-08-15T21:49:28.694981Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","venue":"cs.CV","work_id":"4700f628-b9da-4e5b-88de-b527bde6656e","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.087787Z"},"links":{"cited_paper":"/paper/2412.16158","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:7dc4feda93fd5e0e208199085576885688fc7a7614736b3560aa3be89641d326","observation_id":"84b0381f-ec30-40e2-8293-c9407eb28d2f","resolution":{"observed_at":"2026-08-15T21:49:28.700017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-17T13:10:38.666411Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-15T21:49:28.091627Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.091627Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:8075f5ed6ed439d838d272088723ff57929c4ad09406834d5e4aaf3dc2719875","observation_id":"3335f5c4-4051-491a-b313-b5ff7f2c1351","resolution":{"observed_at":"2026-08-15T21:49:28.091627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T21:49:28.110794Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.110794Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ff55d1badb60dd90dd92f75467b4145c48c3d340b44c72d7f57e82953a2edded","observation_id":"ad5553e3-56c8-4a2e-89a1-af392a36dd7a","resolution":{"observed_at":"2026-08-15T21:49:28.110794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-17T13:43:29.791103Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07617","snapshot_observed_at":"2026-08-15T21:49:28.099780Z","title":"Scaling pre-training to one hundred billion data for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.099780Z"},"links":{"cited_paper":"/paper/2502.07617","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ab0500a1ebf9e718b7d71808fcc24e3c5800a81a1ea3b5ce8d58227f8862a44a","observation_id":"1d93d7d5-4d49-4725-bcc1-7909cbddcb40","resolution":{"observed_at":"2026-08-15T21:49:28.099780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-16T18:01:13.363095Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T21:49:28.103319Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.103319Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:1a8c11e3d7f995e23c576cbf1b57b740007f7782ef0325c0f58ca1fadb03029d","observation_id":"d9749ed0-4144-48d1-ad61-70dc9e887f97","resolution":{"observed_at":"2026-08-15T21:49:28.103319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-08-17T11:42:02.077158Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-15T21:49:28.107044Z","title":"Instructiongpt-4: A 200-instruction paradigm for fine-tuning minigpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.107044Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:bcf8cf3ea157534e4f3d91943c5e75db4b10e4c893fdd3203e56e277f7d27b8c","observation_id":"0d837735-db69-4a1c-a801-adf9a07ce6de","resolution":{"observed_at":"2026-08-15T21:49:28.107044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.253205Z","title":"Knowledge-augmented few-shot visual relation detection","venue":null,"work_id":"4deee030-a775-43e9-9094-5906150559a3","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.125115Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:9e52ac563df7aa61b715cc687e2251dcf5df0efd84dfd8731a781e94f3e5d0a5","observation_id":"d5f5d2ea-f6fa-4feb-a59e-cef1e23e31cd","resolution":{"observed_at":"2026-08-15T21:49:29.257203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:49:28.114329Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.114329Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:be6fd21d1f595d43d11d6ac83dc38d00d62103c6d4b1accad566b9b62625bad5","observation_id":"eed933be-e5d8-4304-81af-4f50737727fe","resolution":{"observed_at":"2026-08-15T21:49:28.114329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14846","last_updated":"2025-05-21T14:42:25Z","snapshot_observed_at":"2026-08-17T16:15:38.080866Z","submitted_at":"2025-02-20T18:55:30Z","title":"Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14846","snapshot_observed_at":"2026-08-15T21:49:28.118433Z","title":"Scaling text-rich im- age understanding via code-guided synthetic multimodal data generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.118433Z"},"links":{"cited_paper":"/paper/2502.14846","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:b03f11caadeb5cee75524a4db9e25ea549a6f2c67df873d4dd3c5c4c6d5e45c6","observation_id":"290d4613-fbd5-4354-b505-ccf4a1af24e1","resolution":{"observed_at":"2026-08-15T21:49:28.118433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.121972Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.121972Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:06bbb2dc52ef3f2a90dac49f6ec75b77794ded22038db5105936162bb8e0ef64","observation_id":"f3c8e3e5-187a-4f61-b571-83731f8e9d7a","resolution":{"observed_at":"2026-08-15T21:49:28.121972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18411","last_updated":"2025-03-01T03:09:28Z","snapshot_observed_at":"2026-08-16T12:55:16.639239Z","submitted_at":"2025-02-25T18:05:14Z","title":"OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18411","snapshot_observed_at":"2026-08-15T21:49:28.140238Z","title":"Omnialign-v: Towards enhanced alignment of mllms with human preference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.140238Z"},"links":{"cited_paper":"/paper/2502.18411","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:ac1268f912fbcc80b2c134bd6b6b4021ce6503dfb5e2e160ed7289c41a8cc27c","observation_id":"5713fdfb-d4ab-4fe3-8ad7-32ea69cf88df","resolution":{"observed_at":"2026-08-15T21:49:28.140238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.240891Z","title":"Xing, Xiaodan Liang, and Zhiqiang Shen","venue":null,"work_id":"010d6e39-e400-4b67-83ec-b95649fef898","year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.129074Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d2e9b40d716b0e544c5cbfa5bebb895bdeb8538c534b4562be454d786359c8e5","observation_id":"048a03d7-ca78-4126-a150-c8fcb0b526ad","resolution":{"observed_at":"2026-08-15T21:49:29.244964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.132406Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.132406Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:d8f5d20b96c110fe33f50ac820b014625bbf742d8b477066c3d346c0a8b5e035","observation_id":"3aea2af3-136b-4e7b-94b9-a7548592bc4a","resolution":{"observed_at":"2026-08-15T21:49:28.132406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-16T12:41:13.823758Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-15T21:49:28.136196Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.136196Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:06608081aee46076b82a42573014f701c7c0e7a48cca1882d74b84d7f3427450","observation_id":"443d7519-58aa-4878-8b9a-b7cf2ec0812a","resolution":{"observed_at":"2026-08-15T21:49:28.136196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2310.02239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.234311Z","title":"Minigpt-5: Interleaved vision-and-language generation via generative vokens","venue":null,"work_id":"9dfffd73-e8df-4671-91b4-d5db80138ebb","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.144082Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:36a656a2702b26c8043428f3451cc638a3b1f76a88866aaab5905fe180b7ad0c","observation_id":"e80c6efc-31ac-41fb-aad6-ac2ca9b4bde8","resolution":{"observed_at":"2026-08-15T21:49:28.240603Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:29.228745Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":"ca0dcc42-f204-498b-b25d-2683a5d5c7c1","year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.147999Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:f07ea341bc05293b73be52ab97b257a0368798a80c1891a7fd25614d65c01c3a","observation_id":"0b3a4518-f49f-4699-99a1-4af729b51b37","resolution":{"observed_at":"2026-08-15T21:49:29.232823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:28.151834Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.151834Z"},"links":{"citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c13066232efd09a963a57245db8e01935628578957b46796ab8d1ba046f374cd","observation_id":"87d92ebd-c559-40de-af3c-bd1e0548a290","resolution":{"observed_at":"2026-08-15T21:49:28.151834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05243","last_updated":"2024-12-06T18:22:47Z","snapshot_observed_at":"2026-08-11T20:47:10.764744Z","submitted_at":"2024-12-06T18:22:47Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05243","snapshot_observed_at":"2026-08-15T21:49:27.718480Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.718480Z"},"links":{"cited_paper":"/paper/2412.05243","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:814079d45fd03e4bef9784b94b95e2339d99a738d3d4e8ed0e7b8fd02f6e56ff","observation_id":"d08c95db-92d6-44b6-a2db-cdbd44d42d01","resolution":{"observed_at":"2026-08-15T21:49:27.718480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:12:00.970827Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":5,"verified_fuzzy":9},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.08971."}